Research notes · 2026 年 9 月 8 日
Lenny 播客半年 AI 实践调研
Lenny’s Podcast 2026 年 3 月 8 日到 9 月 6 日的 30 期访谈里,美国公司怎么用 AI 提效、改组织、把 AI 放进日常流程、挣到钱、做产品和增长。按五个问题归纳,每条结论都钉到具体嘉宾和时间点,点时间戳可跳到 YouTube 原话。
先说结论
30 期里 27 期有实质内容,13 期嘉宾在讲自己公司内部怎么用 AI。一线公司说的是同一件事:写代码和做原型的成本接近零,瓶颈搬到了验证、判断和跨部门协调。Anthropic 工程师人均每季度合入代码量是 2021 到 2025 年基线的 8 倍,OpenAI 90% 员工每周用 Codex。
组织上的变化集中在三处:团队变小(Instagram 标准团队从 13 人改到 6 到 7 人)、角色合并(工程师当 PM,设计师提 PR)、经理回去做一线(Whatnot 管 PM 的人 90% 时间做 IC)。PM 该不该存在是半年里最大的分歧。
AI 进流程最成熟的形态是定时任务加一个公司级 agent,而非人手一个 agent。PM 的交付物从 PRD 变成 eval、原型和 A/B 结果。挣钱的是模型层和实施服务,应用层靠分发。Token 目前不设上限,多位嘉宾预计 6 到 12 个月内公司会开始追问 ROI。
代价是真实的:约 6,000 名科技从业者的调查显示 burnout 从 44.7% 升到 54.7%,97% 的人说 AI 让自己更快更多,但没有更好。
一、样本:30 期,13 期高相关
取 2026 年 3 月 8 日到 9 月 6 日期间发布的全部 30 期,字幕来自 YouTube 自动英文字幕,共约 51.7 万词。按和五个问题的相关度分三档:高相关 13 期,这些嘉宾在讲自己公司内部的做法;中相关 14 期,有一手案例但主线是别的;低相关 3 期,是个人访谈、治理或薪酬谈判类话题。完整清单在第八节。
嘉宾来源集中:Anthropic 4 期(增长负责人、Claude Code 产品负责人、Claude Code 团队负责人、研究产品负责人),OpenAI 3 期(Codex 桌面负责人、ChatGPT work 负责人、设计负责人),加上 Netflix、Instagram、Snap、Notion、Whatnot、Cursor、Every 各一期。这意味着本文里“美国公司在做什么”的证据偏向模型实验室和 AI 原生公司,传统企业的声音主要经由 Benedict Evans、Anish Acharya 和 Jen Abel 转述。
二、提效:代码不再是瓶颈,瓶颈搬到了验证和人脑
2.1 数字
| 公司 | 数字 | 说的人 | 出处 |
|---|---|---|---|
| Anthropic | 工程师人均每季度合入代码量是 2021 到 2025 年基线的 8 倍 | Fiona Fung,Claude Code 团队负责人 | 03:03 |
| Anthropic | 功能周期从 6 个月压到 1 个月,部分到 1 周甚至 1 天 | Cat Wu,Claude Code 产品负责人 | 05:02 |
| Anthropic | 5 工程 1 设计 1 PM 的小组,相当于老世界 15 到 20 个工程师 | Amol Avasarala,增长负责人 | 43:21 |
| OpenAI | 90% 员工每周用 Codex;工程师自报提效 10 倍到 100 倍,设计团队没有 | Andrew Ambrosino;Ian Silber | 00:00 04:03 |
| Google(某高管口述) | 没有裁人,2 年路线图 3 个月做完 | Anish Acharya,a16z | 10:03 |
| Snap | 自动代码审查累计检出接近 10,000 个 bug | Evan Spiegel,CEO | 46:23 |
| Cloudflare、Shopify | 各招 1,000 名实习生,上手期从 1 个月缩到 1 周 | Simon Willison 转述 | 29:18 |
| StrongDM | “没人写代码、没人读代码”,模拟员工 agent 测试每天约 $10,000 token | Simon Willison 转述 | 15:10 |
| Whatnot | PM 看数据的时间增加 10 倍,一个资深 PM 覆盖过去三个初级 PM | Tom Verrilli,CPO | 36:13 |
| 个人 | Simon Willison 95% 的代码不再亲手敲;Dan Shipper 连续 10 天 inbox zero | 本人 | 14:08 22:11 |
2.2 瓶颈去了哪里
Simon Willison 把拐点定在 2025 年 11 月:GPT-5.1 和 Claude Opus 4.5 之后,coding agent 从“大多能用但要盯着”变成“几乎都按要求做”,写代码这一步不再是瓶颈 03:00。之后每位一线嘉宾都在描述瓶颈搬到了哪里。
- 验证。Fiona Fung 说 Cowork 团队设计师和 PM 全员提交代码,人变多、学科变杂、吞吐变高之后,新瓶颈是验证 09:06。Andrew Ambrosino 说 100% 代码由 AI 写已经是旧指标,现在问的是有监督还是无监督 39:26。
- 判断和品味。Ambrosino 估计同一个急需的功能,OpenAI 里有 90 个团队在各自试做,“The implementation is actually not the expensive part anymore. It's dare I say taste.” 04:00。Max Schoening 的说法是每个项目的前 10% 变成免费,最后 10% 仍占 90% 的工夫 28:15。
- 跨部门拉人。Anthropic 的 CASH 项目把增长实验拆成找机会、做功能、测试、分析四步交给 Claude,第五步利益相关方管理仍靠人。设计负责人的原话:“We will have AGI and it will still be impossible to get six people in a room to align.” 37:19
- 人脑。Simon 并行开 4 个 agent,到上午 11 点就精疲力尽,他认为人的认知是新瓶颈 26:17。Fiona 说异步 agent 多了之后,她反而要重新给自己划整块时间来消化已经启动的任务,还没有解法 71:40。
- 工期估算失效。Keith Rabois 说 11 月不可能的事 3 月已经很容易,一年期路线图不成立 35:23。Simon 的做法是持续把自以为 AI 做不到的任务丢给它,做不到就记 backlog 28:18。
2.3 非工程岗位的提效
半年里最常被提到的非工程用法有三类,都已经进入日常。
- 产品经理自己拉数据、自己问代码库。Whatnot 的 PM 用 Hex Threads 自己拉 cohort、查单个用户日志、算影响面,CPO 说过去一年他和数据科学家的对话比职业生涯任何时候都少 35:13;他用 Claude 加载 feed 代码,让它讲谁在什么时候看到什么,发现新用户打开 app 时多个模型撞车,直接改顺序 31:12。Instagram 的内部工具已经能自动出漏斗分析,一年前 product staff 做不到 06:04。Netflix 的 finance、content、advertising 业务方自己先查几十年的实验记录出初步假设,再找数据科学家深挖 10:05。
- 高管用 agent 巡视公司。Evan Spiegel 在 Glean 上建了一个 agent,每天翻遍公司所有 dashboard 和文档,告诉他该关注什么 61:31。Amol Avasarala 用 Cowork 定时任务每天早上看 20 到 25 张 Hex 图表,自己只保留几张 58:27。Ambrosino 每天早上看 Codex 生成的日报,覆盖他所在的约 3,000 个 Slack 频道 44:30。Rabois 观察到他任董事的公司里,消耗 token 最多的人是 CMO,因为 CMO 终于可以自己做分析而不用一层层等下属 33:22。
- 把 deck、周报、财务模型交出去。Cat Wu 用 Cowork 一晚上做出 20 页大会 deck,因为它能读公司标准模板,产出“看起来像 Anthropic 设计师做的” 36:18。Anthropic 销售用 Claude Code 做了定制 deck 工具,从 Salesforce 和 Gong 拉客户上下文,20 到 30 分钟的活变几秒 42:23。OpenAI 的 corporate finance 团队用 ChatGPT work 做原来靠一个专家手工完成的复杂财务模型 31:15。Dianne Penn 把 monthly business review 用 skill 全交给 Claude 写,自己只做 verifier 61:58。
Tara Seshan 给了一条区分线:“writing as reporting”全部交给模型,“writing as thinking”绝不交,连初稿和润色都不用 52:28。Penn 的版本是先有自己的观点再上工具 60:55。这条线在多位嘉宾那里反复出现。
2.4 提效的代价
Lenny 和 Noam Segal 做的第二届科技从业者调查(约 6,000 人)给出了另一面。97.2% 的受访者说 AI 让自己在工作上更好,但追问“好”是什么意思,答案是更快、更多,质量没有上去 45:47。显著 burnout 从 2025 年的 44.7% 升到 2026 年的 54.7%,职业乐观度从 54.8% 降到 48.7% 20:18。人们最怕的是“同样薪水被要求做更多”,被 AI 取代排在担忧清单倒数第二 52:52。
质量问题不止来自调查。Max Schoening 说过去 12 个月软件数量增加了,质量没有,实验室自己的工具每两周回归一个三周前修过的 bug 07:03。Tony Fadell 引 Claude 源码泄露后架构师的反应“这东西太脆”,把 AI 在高层抽象上写的代码叫技术债,“You're getting short-term gain for very, very long-term loss.” 52:37。Dan Shipper 自己做了个基准:请两位资深工程师独立重写他 vibe code 的产品,之后每个新模型跑同一 prompt 打分,GPT-5.5 之前所有模型约 30 分,人类高 80 到低 90,GPT-5.5 得 62 41:27。
Noam 把判断力下降叫 cognitive rot:看到模型第一版输出就接受。他的建议是需要“evals for people”,因为人的判断力在退化却没人测量 51:52。Simon Willison 的观察更直接:AI 让重度用户更累,时间多了,脑子空了 35:23。
三、组织:团队变小,角色合并,经理回一线
3.1 团队结构的具体改法
| 公司 | 改法 | 出处 |
|---|---|---|
| 标准团队从约 13 人(2 到 3 个 Android、2 到 3 个 iOS、2 到 3 个服务端、通才、PM、设计、数据)改成 4 到 6 个通才工程师加 1 个 product staff,专家按需加入,核心 6 到 7 人,今年开始推 | 02:00 03:02 | |
| Anthropic 增长 | 约 40 人,两条横向线(growth platform、monetization)跨全部产品,再按受众分 pod:B2B、Claude Code、知识工作者、API | 25:13 |
| Anthropic Claude Code | 不扩 PM,招有产品品味的工程师;几乎所有 PM 当过工程师,设计师做过前端 | 16:08 |
| OpenAI Codex | 工程师两位数,设计师约为其一半,PM 很少;以 IC 为主,很少管理层 | 27:20 |
| Whatnot | 21 到 22 个 PM 支撑全部 GMV,PM 按问题而非按团队分配,某个工程团队可能一整年没有 PM;管 PM 的四五个人 90% 以上时间做 IC | 15:05 23:08 |
| Every | 一年从 15 人到近 30 人,全员通才;咨询、运营、编辑都在提 PR | 04:05 50:33 |
| Snap | 近 10 亿用户的公司配 9 到 12 人的设计团队做创新,无头衔层级;200 人才招第一个 PM | 21:11 31:15 |
Anthropic 增长负责人给出的比例是这半年最常被引用的:工程师从 AI 得到的杠杆最大,5 工程 1 设计 1 PM 的小组用 Claude Code 后相当于 15 到 20 个工程师,PM 和设计只涨到 1.5 到 2 个,“absolutely squeezed” 42:21。他们的应对是“两周规则”:工程量 2 周以内的项目工程师就是 PM,自己去谈 security、legal 和跨部门,PM 只做顾问;超过 2 周 PM 负责到底 45:21。
3.2 PM 存废:半年里最大的分歧
六位嘉宾直接表态,立场分三档。
- 主张收缩或取消。Whatnot CPO Tom Verrilli 的前提是“we regret that product management exists”,默认不配 PM,理由是大量招 PM 会“infantilize”工程师和设计师 06:02。Keith Rabois 认为模型能力变化太快,传统 PM 这种中介角色说不通,无论叫什么,技能都变成 CEO 技能:做什么、为什么 35:23。Nikhyl Singhal 说约一半 PM 是信息搬运者,会被淘汰 25:15。
- 主张保留并进化。OpenAI Codex 负责人 Ambrosino 的原话:“I've heard a lot of companies be like, we're getting rid of the product role, which I think is, by the way, a terrible idea.” 取消角色会连带丢掉学科积累的最佳实践 24:17。Instagram 把 PM 进化成 product staff,用最新工具兼做设计、数据、调研,资深设计师直接转岗 03:02。Tara Seshan 说 PM 的核心没变而且更重要:定义最关键的假设、最快测试、回灌,脱落的是长文档和演示文稿 08:05。
- 主张可能需要更多 PM。Amol Avasarala 的判断是因为工程师太快,未来可能需要更多 PM;在 20 个工程师只有 1 到 2 个 PM 的公司里,把“做什么、为什么”改进 5% 比自己去做第 21 个功能更值 48:21。Dan Shipper 认为 PM 是这轮最大受益者,他举的例子是一位“lightly technical”的前 PM 独自运营一个写作产品,出货速度几乎全公司最快 68:45。
三档之间有一条共同线:留给人的是判断、定义问题和对结果负责。Netflix CPTO Elizabeth Stone 的表述是角色流动健康,但人仍对结果负责,“agent 写的”不免除责任 05:02。Nikhyl 的补充是产品负责人正在把自己的流程写成软件:有公司已宣称完全自动化了产品评审和站会 32:21。
3.3 经理回一线,层级变薄
- Anthropic Claude Code 团队:新经理入职先不带人,花时间钻代码和产品;所有经理持续兼职 IC。Fiona Fung 曾在 Meta 管 500 人、2017 年后没发过生产代码,现在每天提 PR 49:27 51:29。她的另一件工具是一个挂在团队所有仓库、所有 Slack 频道和指标看板上的 Claude Code 远程会话,每月和每位下属共享屏幕跑一遍产出和市场反应 10:06。
- Whatnot:CPO 本人约 50% 时间做 IC;CEO 在评审里说“I don't think this is right”后会清空当天日程,和团队一起拉 ticket、看代码、逐行看数据 50:18。Verrilli 的薪酬观点是把五个 L5 加一个 L7 加 VP 的总薪酬改成三个人,每人拿 VP 的钱 28:11。
- Ramp:一位工程总监带 20 人,个人出的代码量和当 IC 时一样多,做法是把 AI 当第二支团队 40:27。
- Mark Pincus 把这条和硅谷去中层的趋势并列,主张“make everyone a CEO”,给每人一座山头、一份计划和预算 76:01。
Noam Segal 对扁平化提出了警告:调查里 manager 被评为极其有效的人,工作享受度高约 65%,burnout 显著更低,但只有约 25% 的人认为自己 manager 高效。直接汇报人数比以往任何时候都多,而 manager 是唯一能挡住“AI 加压”的人,扁平化可能在放大 burnout 73:07 74:07。
3.4 招聘画像的变化
| 方向 | 画像 | 谁说的 | 出处 |
|---|---|---|---|
| 涨 | Systems thinker:能跨业务域抽象出共同 building blocks,工程画像偏分布式系统和基建,因为 agent 会跨系统运行 | Elizabeth Stone,Netflix | 13:05 |
| 涨 | Product-minded engineer:有商业直觉的工程师“价值涨一个数量级” | Amol Avasarala;Keith Rabois | 46:21 39:27 |
| 涨 | Forward deployed engineer:技术够深、能和销售一起进客户,帮 CFO 从 token maxing 转向控成本 | Adam Ward,Cursor | 07:07 |
| 涨 | Design systems 思维的设计师:做模板和品牌表达,让非设计师也能做出连贯产品 | Elizabeth Stone | 15:07 |
| 涨 | “Engineering manager light”:带很小的团队去试过去认为太难的事 | Tom Verrilli | 43:17 |
| 跌 | 窄而深的专家,编码、播放系统这类全球只有几人懂的领域除外;理由是 AI 让专家更容易横向扩展 | Elizabeth Stone;Adam Ward | 22:15 07:07 |
| 跌 | 面试里大量谈“driving alignment”“stakeholder management”的 PM | Tom Verrilli | 17:06 |
| 争议 | 新人。Cursor 说没经验的新毕业生在跌;Netflix 仍招 intern 和 new grad,理由是年轻人更 AI native;ThoughtWorks 的结论是中层最危险,新人上手反而快 | Adam Ward;Elizabeth Stone;Simon Willison 转述 | 07:07 53:35 30:19 |
面试本身也在变。Netflix 的 coding 面试允许用 AI 工具,并直接问候选人日常用什么 AI、对变化的舒适度 30:19。Netflix 没有按级别重写 career ladder,而是给全公司加一层 AI fluency 期望,按职能和阶段各自解释,高管同样适用 28:18。Whatnot 所有岗位一律做动手 case study,交 PRD 并口头答辩,两年 31,832 人申请 PM 只录用 1 人 17:06 48:18。Cursor 把每个 IC 岗位按高管招聘做:先定义 top 1%,找出全世界符合的 50 个人,再用几周到几年持续接触,每个候选人一个 Slack 频道、高优先级候选人每天 10 分钟站会;他们试过取消 work trial,信号大幅下降后又恢复 17:13 62:36 51:31。
3.5 Token 政策
四家公司谈了 token 怎么管,做法一致:现在不设上限,但都预告了拐点。
- Notion:无上限,个人月花费“肯定上千,也许上万美元”,公司最高的是一个 PM。Max Schoening 预计 6 到 12 个月内多数公司会开始追问 ROI,“那会是不舒服的对话” 34:20。他反对把 token 花费当炫耀指标,和吹嘘代码行数一样 35:21。
- Instagram:无上限,靠关掉“token 焚烧炉”式的无用项目降本;Mosseri 预期一两年内强工程师的 token 消耗与其薪酬相当,到时按公司对此人 ROI 的信任度设额度。他说 token 排行榜是“terrible idea” 21:12 22:12。
- Anthropic:基本不限量但靠信任,浪费 token 很不受欢迎;Cat Wu 说每次模型大跳跃,每个知识工作者的 token 成本都会上升,目前仍远低于工资 49:27 50:28。Fiona Fung 把 token maxing 叫新版代码行数,每一个生产率指标最终都会失真 40:19。
- Dianne Penn 对 Gary Tan “一年花 10 万美元 token 就是活在 2028 年”的回应:花钱是输入,实验才是输出,KPI 应定在实验上 20:13。
成本侧的判断来自 Anish Acharya:按职能分层用模型,收益无上限的职能(drug discovery、sales、support、research、engineering)用 frontier,收益有上限的(legal、finance,“你没法把账关得好 100 倍”)用 open-weight 加 RL 微调的便宜模型,公司里会同时存在两套架构 22:09。Max Schoening 说 Cursor、Intercom 在做自研小模型,Notion 在试,前提是开源模型和前沿的差距不拉大 45:27。
四、AI 进入流程:从个人玩具到公司例行
4.1 定时任务是最常见的形态
半年里最多嘉宾在用、也最容易照抄的形态是定时任务:一个 prompt 加一个连接器加一个固定时间,产出让人审。
- Fiona Fung 的晨间 routine:每天固定时间读 Slack 反馈频道、归纳主题、把能顺手修的小问题直接生成 PR,她醒来只需评审。她说 routine 的本质是“生成 prompt 的 prompt”,抽象层级又上了一层 12:08 35:16。
- Amol Avasarala 的每周错位扫描:Cowork 接 Slack MCP,定时扫他参与的项目,输出可能的组织错位清单;企业团队负责人用同样方法抓到过多个团队重复做工 55:26 64:31。他还让 Claude 每周看直属下属的进展、OKR 和会议转录给出反馈建议,再反过来让 Claude 以经理身份给自己反馈 61:30。
- Ambrosino 的 Codex 日报:建一个计划任务,写清关心哪些频道、哪些类别;纠偏靠对话,“下次多关注这个、这件事没进日报请补上”,它自己改指令 44:30。5 月的多团队协调发布,他用一份 Notion 总表让 Codex 自动从 PR 和 Slack 收更新 43:30。
- Claire Vo 的 9 个 agent:3 台 Mac mini 上跑 OpenClaw,按岗位拆成销售、播客制作、课程项目经理、家庭日程等。销售 agent 每天早上做 PLG sweep:扫 CRM 过去 24 小时注册,筛出公司域名,用 Exa 查是否决策者,发软性欢迎邮件,员工 10 万人以上的公司先请示;这替代了去年每周付费 10 小时的人工 50:34 52:36。
- Dan Shipper 的季度规划:一个 Notion agent 拿着公司战略逐个访谈每个员工,会追问,最后产出每个团队的计划文档,CEO 只看哪些团队该互相聊、哪份质量低 63:38。
Cat Wu 给这类自动化定了一条硬标准:做到 90% 到 95% 就放弃的人很多,但 95% 的自动化没什么价值,要么做到 100%,要么别做 69:36。她的另一个观察是反过来的:有人过度折腾 skills 和 MCP,不睡觉不干正事,简单设置效果更好 72:39。
4.2 一家公司一个 agent,而非人手一个
Dan Shipper 的核心预测是一家公司一个 super agent,理由是个人 agent 维护成本太高,一旦没人在乎它就没用了。他的说法是“Automation is a lie”:每自动化一件事,就需要一个人盯着它。做法是设一个 forward deployed engineer 负责让全公司的 agent 正常工作,再往下长出团队级 agent 13:10 38:25。Every 内部有一个叫 Claudie 的 agent 跑整个咨询业务,AI 工程师大部分时间在 Slack 里和它对话、纠正它 54:36。他提到某大模型公司内部有一个接数据仓库、知道每个人权限的 data science bot,专门一个团队维护,数据科学家因此只处理深问题 56:36。
Anish Acharya 用“loop”描述同一件事的下一步:工程里已经跑通的 loop 是 bug 报告进来,自动复现、修复、review,高风险人确认、低风险直接上线,再给客户发邮件,全程 5 分钟;增长团队的 loop 是每个变体自动生成、测量,统计显著就合并,保留长期 holdout。Loop 只能爬到局部最优,之后需要人把它放到下一座山脚下 12:04 14:05。他举的传统企业案例是墨西哥二手车平台 Kavak:每个客户配一个 agent,卡住时打电话给人,人教一遍,agent 记录并学习,下次不用再打;全公司包括修车技师上 6 周“Jedi Academy”,结业标准是每人 ship 一个在生产环境跑的 agent 19:07 09:03。
Tara Seshan 指出了现状的缺口:现在每人和自己的 agent 一对一,同事之间靠在 Slack 里发 Codex 线程截图解释“我这个数字怎么算出来的”,团队正在做多人一起指挥一群 agent 的界面 16:10。
4.3 PRD 让位给 eval、原型和 demo
这是嘉宾之间意见最集中的一处:PRD 的地位在下降,但下降的方式不同。
- Anthropic 增长团队 60% 到 80% 上线的东西没有 PRD,小事在 Slack 说,大事开 30 分钟跨部门 kickoff 把 legal、safeguards 拉齐;需要写时用一个装着历史 PRD 的 project 生成 51:22 53:23。Claude Code 团队用每周 metrics readout 加一份 team principles 替代大部分 PRD,让工程师不用等 PM 就能自己决策 09:05。
- Dianne Penn 的“Evals are the new PRDs”:用户说“Claude hallucinated”太模糊,团队读 consented transcript,把失败拆成工具调用、搜索综合、alignment 三类,写 30 到 40 条 prompt 加 golden answer 的 eval,每个新版本回归。一个案例:“不听指令”的反馈约 80% 其实是 JSON 格式问题,现在通过率 99.9% 到 100% 29:24 44:34。Cat Wu 说不需要几百个,10 个好的 eval 就能让团队量化目标 54:31。
- Max Schoening 把 GitHub 时代的“demos not memos”接了过来:先做粗糙版 demo,一次派 10 个 agent 探索 10 个方向 29:16。Shopify 两年多来禁止 PM 用 PowerPoint 讲产品,所有产品汇报必须是能跑的 demo 42:27。Webflow 一位产品负责人用过去公开的 product review 转录训练了一个 GPT,团队要求 PM 把 PRD 和 pitch 先过一遍,问“CPO 会在哪里反驳、想法哪里弱” 19:14。Tara Seshan 说长文档不再是“想清楚了”的信号,因为很容易生成一份长文档来掩盖没想清楚;沟通载体变成 mocks、prototypes 和 A/B 结果,她写到 70% 就拿出去讨论 55:32 57:36。
- 反方:Ambrosino 说 PRD 没死,实现便宜了,非工程师容易直接跳到原型,工程师则容易写一堆没人读的文档,要点是按目的选媒介;原型看着能上线,实际还在探索早期,团队要显式说明“我们在流程的哪一步” 07:02 09:04。Penn 也说每个模型仍有一份 PRD,作用是给产品、工程、legal、safety 一份共同事实 47:38。
4.4 验证和质量框架
写代码变快之后,几家公司各自发明了保质量的机制。
- 把“什么叫好”提交进仓库。Fiona 团队把内容设计规范之类的标准作为 spec 提交进代码库,让 Claude code review 对照检查,规范随代码更新 15:09。Notion 工程侧的标准来自 Simon Last:写代码环节的任何人工干预都应被当成 bug,说明验证循环没搭好;审查环节例外 38:23。
- 两级质量框架。Anthropic 用 bad 和 sad 两级:bad 是不可恢复的严重错误,sad 是可恢复的痛点,各团队自己定义本表面的 bad 和 sad,用于跨产品面看质量趋势。另有一个从去年 9 月起的“脏话看板”,统计用户在会话里骂人的频率作为挫败感指标 45:25 47:26。
- 测试回到中心。Simon Willison 说 agent 必须运行代码,否则回到从 ChatGPT 复制粘贴;“red/green TDD”五个字代替一大段指令 67:46 70:48。Fiona 在 Claude Code 修的第一个 bug 就是先让它写一个会失败的测试 16:10。StrongDM 用一群模拟员工 agent 在仿真 Slack 里 24 小时发权限请求,自建了 Slack、Jira、Okta 的仿真版 16:11。
- 人人能发代码之后的设计评审。Webflow 内部技能被打平,人人能做设计、发代码、写 PRD;CPO 随口说“以后得考虑设计评审”,设计负责人一小时内录了一个 Loom,给出高风险和低风险设计改动的分类、影响范围(blast radius)和发布流程 38:26。Jessica Fain 的另一条是把 agent 当不懂公司产品哲学的初级员工来 onboard:先写下自己作为产品负责人相信什么、怎么定义 PMF、哪里成功过哪里失败过,持续喂给它,再定护栏,哪些事“没有我不许做” 77:58。
- 代码审查成为 merge 前必过关卡。Cat Wu 说之前几次尝试都不够准,到 Opus 4.5 和 4.6 才能并行跑多个 review agent 扫整个代码库综合出真问题 63:33。Snap 的内部版 app 摇一摇报 bug,agent 定位原因并建议修法 46:23。
- 知识工作的验证和代码不同。Tara Seshan 说编程可以靠测试验证输出,知识工作不能只看最终的 deck 就相信里面的数字,必须看过程、输入和引用,所以 ChatGPT work 的产品重点是让用户看到进行中的工作 64:44。Elizabeth Stone 坦白 agent 生成的代码性能更好但看不懂,“that makes me uncomfortable” 57:37。
4.5 计划周期压到一个月
Fiona Fung 入职时推的六个月轻量路线图,三个月后发现没人再看。现在叫 JIT planning:按月排,没有文档,只有一张小表列本月最重要的事,每周快速确认一次,半年一次全员聚会定主题 83:49。Ambrosino 的规则是越近期越要细,9 个月以上的计划保持模糊,加精度就是假精度 31:22。Tara Seshan 更具体:只为模型 2 到 3 个月后的能力做产品,按当前能力做会错,按一年后做也会错,产品路线图和研究议程绑在一起 27:14。Whatnot 每 6 个月由 CEO、CPO 和高级负责人定“接下来 6 个月哪些事必须成立”,逐项找 DRI 16:06。
配套的做法是“每次新模型出来就把以前做不了的事再试一次”。Amol、Fiona、Dan Shipper、Anish Acharya、Caitlin Kalinowski 都独立说了这条 15:10 76:46 76:47 26:10 92:01。Cat Wu 的团队会先做“当前模型还跑不通”的产品原型,新模型出来直接换进去看缺口补上没有;每次新模型上线还会通读整个 system prompt,逐段问“模型还需要这条提醒吗” 64:33 62:33。
4.6 安全边界
- Simon Willison 的 lethal trifecta:私有数据、暴露给外部指令、能外发,三者同时具备就危险;砍掉一条腿,通常砍外发。过滤器拦截率 97% 是不及格,要假设任何能和 agent 说话的人都能让它做它被允许的任何事,然后限制 blast radius 80:56。
- Claire Vo 的安装清单:干净的机器、独立邮箱、独立管理员账号、soul 文件里限定只听一个渠道的指令、用贵模型、逐步授权(先日历,再读邮件,再草拟,再发送);家庭 agent 和工作 agent 物理隔开 18:12 23:13 45:28。
- Caitlin Kalinowski 把 OpenClaw 沙箱在独立电脑上,只给了真实邮箱等三样信息并叮嘱不要泄露,加入 Moltbook 5 分钟后它就把她的私人邮箱发出去了 25:17。
- Evan Spiegel 选 Glean 而非直接用 Claude 做公司数据 agent,理由是 Glean 是访问公司文档和 dashboard 最安全的方式 62:31。
4.7 传统企业怎么进:清单、实施服务和培训
Snap 给 AI 落地“定秩序”的方法是从用户和广告主的 jobs to be done 出发列清单,用户侧如“下载 app、加密友、用 lens”,广告主侧如“进入广告平台、配置 campaign”,列出来之后哪里能用 agent、哪里要围绕这个 job 组跨职能团队就清楚了,也能按每个 job 追踪业务结果。一边让人人试 agent,一边用清单把精力锁在重要的事上 47:23。
Benedict Evans 解释了为什么 OpenAI 和 Anthropic 都在买咨询公司、招 forward deployed engineer:大公司没有一堆闲人等着做“重想全部内部流程”这种项目,这个项目需要 5 到 10 个人坐一两个月想清楚,再花另一个项目把系统接起来、改工作流、培训人。对创业公司的含义是卖 AI 给企业时,实施服务本身是产品的一部分 10:06。他的另一句:你付钱给 McKinsey 不是为了那份 deck,Claude Code 能做一个很烂的版本,你买的是他们走遍你的公司、搞清楚政治 15:11。
Jen Abel 从销售侧补了 FDE 的经济账:卖 10 万美元的单子配一个全职 FDE 跑不通,Palantir 能这么做是因为客单数百万美元;如果是因为产品太难用才需要 FDE,是坏信号 59:36。Qasar Younis 从物理行业补了推力:农民平均年龄 58 岁左右,10 年后大批退休,长途卡车司机的家庭代价太高,自动化是补空缺,不是整个行业一夜被替换;他检验一项 AI 产品是否出圈的标准是去 Detroit 机场登机口看有几个人在用 29:25 27:22。Anish Acharya 的对比是电力从发明到工厂重组用了 40 年,最有野心的公司在围绕模型重想一切,其他公司在给现有岗位发工具 09:03。
五、用 AI 挣钱
5.1 模型层的数字
Anthropic 增长负责人给的 ARR 曲线:2025 年初 10 亿美元,年中约 40 亿,年底 90 亿,2026 年 2 月底 190 亿,14 个月从 1 到 19 亿 03:01 10:07。到 7 月底 Lenny 转述的数字是约 500 亿美元,嘉宾未确认 03:01。他 70% 的时间在处理“success disaster”,即增长快到把获客、激活、付费各环节撑坏 12:08。Codex 自 2026 年 1 月起用量涨 6 倍,周活超过 500 万(Lenny 引数据)01:00。Simon Willison 说 2025 年两家实验室都发现“code is the application”,Claude Code 出来后大量人付 $200 一个月,两家把全年训练重点压在代码上 03:00。
押注 coding 的逻辑,Amol 说有两层:商业上 TAM 大,更重要的是 coding 做好能加速研究,模型更好又加速 coding。Anthropic 早期是最小、钱最少的玩家,没有 Meta 和 Google 的分发,没有 OpenAI 的先发,所以只能选一个窄方向 67:34 68:34。Penn 补充 2023 年没人把 Anthropic 和 coding 放一起,是她观察到用户开始用模型写长代码,推动 Opus 3 针对训练 11:06。
5.2 钱在哪一层
Benedict Evans 的判断是模型厂商没有网络效应、没有赢家通吃、产品差异不够大,所以没理由有定价权,最终更像 AWS 而不是 Windows。他用电信做类比:全球移动行业年收入约 1 万亿美元,capex 约 2,000 亿,数据流量是 2010 年的 1,500 到 2,000 倍,股价 25 年没动,因为所有酷东西都在上层 33:20 35:20。他说现在的 token 花费是激进的价格失衡,有人一个月花 150 万美元,相当于 2010 年 5 万美元的手机流量账单 36:21。Anish Acharya 的说法相近:Fable 5 比 Opus 4.8 多“一个 IQ 点”要贵 100 倍,只有收益无上限的行业值得付 22:09。
Qasar Younis 对软件股抛售给了一个机制推测:对冲基金找 AI 咨询公司几周做出一个看起来像 Figma 的 app,公司方说这只是长得像、没有深度和集成,但投资人看到的是“你 500 个工程师干了几年,这东西一个月就有了”,于是立刻把风险定价进去 14:13。
SaaS 会不会死,两位嘉宾都说不会。Max Schoening 说 2010 年代的 SaaS 很多是套在表格外面的精致表单,这部分会变,但“as a service”的部分是维护和一群专家持续想一个问题,人们不想自己养全栈,Anthropic 用 Slack、大家用 Workday 是例子 24:14。Dan Shipper 的角度是 SaaS 在用户的 agent 里跑时消耗的是用户的 token,厂商不用付,这会救回 SaaS 的毛利;Every 全员用 agent 但 SaaS 支出同比上升 24:13 37:22。他给 SaaS 厂商的准备清单是做 CLI、让 HTML 对 agent 可用、CLI 里发生的事立刻在 UI 里显示 28:17。
Evans 的一句话是分发决定一切:“if the product is a commodity, then the distribution is what matters.” Meta AI 撒在所有产品表面、产品“不差”,在调查里用户量排进前三 43:24 44:24。Anish Acharya 说上一代 founder 都学过网络效应,所以今天每个网络都严防别人在自己上面建网络,第三方分发退回到真正的口碑 59:28。
5.3 卖给企业:流程没变,pilot 变短
Jen Abel 用“向 SpaceX 法务部卖 10 万美元产品”走了一遍 15 步流程。和 AI 直接相关的几条:
- 不能只搭“AI mandate”,每家公司都有 AI 指令,每个供应商都说自己是 AI 工具,要讲清楚帮高管在业务单元里解锁了什么,以及他拿到董事会上会怎么说 10:07。“做得快 10 倍”在客户看来仍是同类商品,差异点是帮对方重新想 AI 时代的团队结构 17:12。
- 客户提“省 token 成本”时有两种动机:低优先级事项只要最便宜的,做到 60% 就行;高风险事项(法务的风险、合规延误)可以按 25 万到 50 万美元起步定价 27:19。
- Pilot 限定 2 到 3 天、3 到 4 个 power user、3 个明确任务,成功标准和客户共同起草;用户半天就能看出有没有价值,把 pilot 从两周压到 48 到 72 小时能缩短两周销售周期 48:28 52:31。
- 价格和销售周期挂钩:90 天能签 10 万美元就一直这么做,要 9 个月的单子应收 25 万到 30 万美元。健康赢率 25% 到 35%,“If your win rate is higher than that, your price is too low.” 59:36 68:41
- 服务费仍是企业预算里最大的一项,企业习惯买服务;对成熟度低的客户可以先卖服务再卖软件 78:45 79:45。
Anish Acharya 从买方侧确认了窗口:企业愿意为员工付每月 200 美元,愿意在不完全清楚买到什么的情况下签百万美元 ACV 的合同,现在像 2009 年圣诞节人人拿到 iPhone 想装 app 62:30。Adam Ward 说 CFO 已经开始收到 AI 账单,需要有人帮他们从最大化 token 转向按任务选模型,这是 FDE 岗位需求的来源之一 07:07。
5.4 定价与 token 成本
- Tony Fadell:消费者不会长期付 20 或 200 美元一个月给 AI,除非它不可思议,很多人的体验是付了钱拿到 Siri 1.0。含义是把 AI 藏进产品,让它便宜到用户不用算账 69:47。
- Mark Pincus 转述 Gary Tan 的想法:今天买的 token 一两年后基本免费,所以现在就按“token 免费”来重新设计消费服务;当下 premium 游戏和 app 调 AI 会撞 token 上限,绕过这个限制本身可能是创新点 66:58 67:58。
- Anish Acharya 反过来主张消费级软件可以很贵:练习题是“我们产品的 Birkin bag 版(每月 1,000 到 10,000 美元)要做到什么才配这个价”,价格是 PMF 的一种度量。Lenny 说自己同时有多个每月 200 美元的订阅,Cursor 出了每月 300 美元的档 66:32 58:27。
- Anthropic 限制了 OpenClaw 等第三方用 Claude 订阅的用法:需求太大,harness 是为第一方产品的使用模式做的 token 效率优化,决定优先第一方产品和 API 13:06。
5.5 新的收入形态
- Claude for small business:Cowork 里一个开关,把小商家常用的插件打包,起因是 Fiona 帮开餐馆的朋友上手时对方不断问“有没有某某插件”。Cowork 本身也是从“很多非程序员在用 Claude Code”这个潜在需求里长出来的 33:16 32:16。
- 一人公司。Claire Vo 一个人跑 ChatPRD,企业客户多,PLG 注册转企业线索交给销售 agent;Maven 课程因为有 agent 支持才敢接,第一版请不起运营和工程师,用 agent 顶上 50:34 59:40。
- 把 forward deployed engineer 能力当咨询卖。Every 把内部维护 agent 的工程师外派给客户 54:36。
- OpenAI 合并 Codex 和 ChatGPT 的决策依据是一个行为信号:市场、公关、财务、法务都在用 Codex,尽管它对这些人“actively hostile”;公司先把 Codex 能力加进 ChatGPT 桌面版和 Atlas 浏览器,结果没人离开 Codex app,才决定合并 52:35。
- Nikhyl Singhal 给社区做了三个 agent:成员配对、岗位与求职者匹配、基于他内容训练的问答;他读别人的提问和 AI 的回答,找出“LLM 和我在哪里不一致”再写文章 59:44。
六、产品、运营、增长
6.1 增长团队的新配方
Anthropic 增长团队的三条做法最完整。
- 用 Claude 自动化增长实验。CASH(Claude Accelerates Sustainable Hypergrowth)几个月前启动,Opus 4.5 之前跑不通,4.6 之后开始出结果;目前只做文案改动和小 UI 调整,有人审批,胜率相当于 2 到 3 年经验的初级 PM。把一次实验拆成找机会、做功能、测试、分析四步分别打分,每周看每步是否变好。下一步把品牌 guideline 写成 skill 减少人审 34:17 36:18 38:19。
- 从小优化转向大赌注。传统增长团队 60% 到 70% 精力做中小优化,Anthropic 反过来 70/30 甚至 50/50 偏大赌注,理由是普通产品两年后价值涨 30% 到 50%,AI 产品两年后价值涨 100 到 1,000 倍,只做小优化会错过。Chrome extension 就是增长团队做的。他说这套只适用于 AI 是核心价值的产品 26:13 28:14 31:16。
- 加对的摩擦。Claude onboarding 问用户是谁、感兴趣什么再推荐产品,很多人嫌流程长,但数据支持;他在 Mercury 那一季放弃指标只修 onboarding 质量,是到 Anthropic 之前最有效的一个季度 20:12 19:12。从 ChatGPT 导入记忆这个功能,本质是解决新用户冷启动 14:10。
激活是 AI 产品最大的难题,他叫它“capability overhead”:模型能力涨得比产品能引导用户使用的速度快,围绕一个模型跑完实验时,下一个模型已经让结论过时 14:10。Ian Silber 在 OpenAI 看到同样的问题,做法是主体验极简,把前沿功能先放到桌面端、Codex、ChatGPT work 这类高意愿用户会用的地方试,验证后再收进十亿用户的主体验 39:35。
Mark Pincus 对增长团队的批评是 AI 被用错了:人们用它花三个月做一个想法,而不是一天测 100 个,“build it wrong before you know it's right” 35:28。他的 FarmVille 案例是把原本要花 1,000 万美元投站外广告的注意力挪到游戏板上,把扩展包的不同美术版本锁在板上看点击,顺手卖提前两周进入的钥匙,收入 1,900 万美元,营销动作同时变成产品测试和收入 37:29。
6.2 产品:发布方式和形态
- Research preview 降低发布承诺。Claude Code 团队几乎所有功能以 research preview 发布,明确标注早期产品、可能不长期支持,一两周就能出;工程师内部 dogfood 后贴到 evergreen launch room,docs、PMM、DevRel 次日出稿 07:03 08:04。代价是产品一致性,内部喜欢两种形态就都发出去让外部投票,因此违背“不做 onboarding”的原则加了 /powerup 25:14。
- OpenAI 设计团队的双轨。先判断这个功能一个月内会不会因模型能力、延迟变化而被推翻,会的就公开快速迭代,有的从想法到上线 4 小时;不会的才走完整的白板、Figma、原型、dogfood,“we try 100 things, we throw out 99” 34:26 33:25。
- 同一个功能可能要发六次。Ambrosino 说 Operator、Atlas 里的 agent、Codex web、内置浏览器本质是一条线,每次换更聪明的模型结果不同;原版 Codex web 让模型自己去干完再回来,形态太超前,“we were too AGI-pilled for the moment”,Claude Code 全本地、会问问题,反而对上了当时模型水平 35:25。写完代码不等于该发布,它成了一个可以拿未来模型来测的样本。
- “Claude 8 test”。Penn 常问团队如果 Claude 8 出来用户行为怎么变,今天该怎么建,产品要 forward compatible 34:28。Cat Wu 说 PM 最难的技能是定义一个月后产品该长什么样,要“the right amount of AGI pilled”:为超强模型做产品很容易,一个文本框就够,难的是为当前模型榨出最大能力 51:29。
- 把自动化看成产品线索。OpenAI 观察全员自建工作流,重复出现的模式(很多人用 Obsidian 或 Notion 搭“记忆宫殿”)升级为一等功能 47:30。Fiona 判断潜在需求的标准是看用户是否在“跳圈”才能把事办成 34:16。
- Tara Seshan 的形态判断:知识工作产品的北极星是用户不做选择,输入任务后系统自动选 harness 和模型;ChatGPT 里 work 底层就是 Codex,去掉了编程 UI 29:14 32:15。她不再做 docs 和 sheets,改做一句提示词生成的小网站:团队游戏、徒步登记、接内部数据的看板 48:25。
6.3 设计的处境
Lenny 的调查显示设计师和研究员是科技行业里最焦虑的人群 04:03。Ian Silber 的解释是工程师靠 coding agent 提效 10 到 100 倍,设计流程因为要反复试错、要多方达成一致,没有同样压缩,加上没人说清设计师现在该做什么 04:03 05:03。Ambrosino 从训练角度补了原因:设计比代码难打分,人类品味是反馈回路的一环;实验室优先训练能加速 AI 研究的能力,写对代码在飞轮里,设计不在 12:06。
各家的应对不同。Netflix 招 design systems 思维的人做模板和品牌表达,让非设计师也能做出连贯产品,避免出“Frankensteins” 15:07。Notion 搭了一个小的、对 LLM 友好的 playground 代码库,把设计师和 PM 引到终端里用 Claude Code 和 Codex 做原型,后来他们也能向生产库提交;Max 说宁要一个懂 agent loop 怎么运作的设计师,也不要一个只会调 UI 样式的 03:00 08:05。Ian Silber 给团队的口头禅是“do less”:能用现有组件就不新设计,能扩展现有功能就不做新功能 31:23。他的一位朋友筹划创业时打算 2 个设计师配 1 个工程师,过去常见的是 1 配 15 15:11。Snap 走另一条路,设计是发布的强制关卡,宁可慢也要一致 36:19。
Elizabeth Stone 直接反对“设计流程已死”:大型消费产品把复杂性藏起来靠的是设计思维,不能被写代码变快挤掉 20:13。Mosseri 看多设计师,因为 taste 最难被自动化,他预计最强的 product staff 会来自设计和数据科学转岗 08:04。
6.4 分发和平台
Mark Pincus 认为 AI 还不是平台:有了新入口,但既不是硬件平台,也还不是给其他 app 用的界面平台;新平台的标志是打开“发现”,而现在平均每人每月新装 app 为 0,去年 App Store 上线约 4 万款游戏 0 款进前十 61:53 63:53。他预期各大 LLM 在编码上竞争之后会回到消费者,出现面向消费者的 agent 平台,agentic travel agent 这类服务只有嵌进 OpenAI 或 Claude 才有分发 71:01 73:01。
Anish Acharya 说 consumer AI 被卡住的三件事:模型太贵做不了免费产品、界面问题(chat 适合最高能动性的人,普通人的理想界面是 TikTok)、技术过度偏向生产力而非人际连接和娱乐;open-weight 模型正在解决第一条 34:16。Mosseri 认为 AI 内容对 Instagram 是顺风,合成内容泛滥时人会更追求创作者和真实,但目前还不擅长给 AI 内容排序 40:20。Benedict Evans 的观察是 13 到 18 岁人群里只有 15% 到 20% 是日活,60% 不用,技术圈以外的多数人一两周用一次 08:05。
七、分歧地图
半年里嘉宾之间直接对立的六个问题。两边都是一线的人,本文不裁决。
| 问题 | 一方 | 另一方 |
|---|---|---|
| PM 该不该存在 | Whatnot 默认不配 PM;Rabois 说中介角色说不通 06:02 35:23 | OpenAI Codex 负责人说取消是“terrible idea”;Anthropic 增长负责人说可能需要更多 PM 24:17 44:21 |
| 要不要和用户聊 | Rabois:消费产品不要问客户想要什么,“I hate talking to customers” 51:29 | Spiegel:必须聊,尽早尽多,可以不采纳但要听 25:13 |
| 设计流程死没死 | Jenny Wen(3 月 1 日那期,本文范围外)说设计流程已死;Silber 说大部分功能公开迭代 34:26 | Stone:设计思维不能被写代码变快挤掉 20:13 |
| Token 排行榜 | Max Schoening 理解 Meta 搞排行榜,几万人规模上让人识别外层循环出奇地费劲 37:22 | Mosseri:“terrible idea”;Fiona:token maxing 是新版代码行数 21:12 40:19 |
| 自动化会不会减少人 | Nikhyl 预测 12 到 24 个月内大公司先裁 30,000 再招 8,000 AI-first 22:12 | Evans:Excel 出现后投行分析师没有周五中午下班,做便宜了人们通常做更多;最先进的 AI 公司都在加人 13:06 17:12 |
| 个人 agent 还是公司 agent | Claire Vo:9 个按岗位拆的个人 agent,用管人的方法管 40:23 | Dan Shipper:一家公司一个 super agent,个人 agent 没人在乎就没用 13:10 |
八、30 期一览
按发布日期排序。相关度是本文的判断:高指嘉宾在讲自己公司内部怎么用 AI,中指有一手案例但主线是别的,低指主题与五个问题基本无关。
九、方法与来源
数据获取:2026 年 9 月 8 日用 yt-dlp 列出 Lenny’s Podcast YouTube 频道最近 80 个视频,取上传日期在 2026 年 3 月 8 日到 9 月 6 日之间的 30 期,下载英文自动字幕(en-orig 轨道),去掉滚动重复后转成带分钟标记的纯文本,共约 51.7 万词。每期由一位阅读者按五个问题逐期写结构化笔记并标时间戳,本文在笔记之上归纳,所有时间戳回指字幕里最近的分钟标记,误差在一分钟内。
没拿到什么:Lenny 公开的官方 transcript 文件夹(Dropbox)本次未能访问,GitHub 上的社区归档只到 2026 年 1 月,所以字幕来自 YouTube 自动识别,人名和产品名偶有拼错,引用时已按上下文校正。4 期的默认英文轨道是外语字幕机翻回英文的版本,已换成原始英文轨道重新读过。所有数字均为嘉宾自述或转述,未做独立核实;Lenny 在节目里引用的数字标明为“Lenny 引数据”。3 月 1 日 Jenny Wen(“设计流程已死”)和 2 月 19 日 Boris Cherny 两期在本文时间范围之外,第七节提到时只作背景。
- Lenny’s Podcast YouTube 频道,youtube.com/@LennysPodcast,30 期视频及自动字幕,取样 2026-09-08。各期链接见第八节。
- Lenny’s Newsletter 播客归档,lennysnewsletter.com/podcast/archive。
- ChatPRD 维护的社区 transcript 归档(至 2026 年 1 月),github.com/ChatPRD/lennys-podcast-transcripts,用于确认早期 episode 格式,本文范围内未使用其内容。
- Lenny Rachitsky 在 X 上发布的官方 transcript 文件夹说明(2026 年 1 月),x.com/lennysan,本次未能访问文件夹本身。