有时你需要推倒一切重来
原文:https://every.to/context-window/sometimes-you-have-to-delete-everything
你好,周日愉快!Vibe Check 栏目总是一段充满意外转折的旅程。当我们与 Anthropic 团队一起测试 Opus 5 时,截止日期不断延后,发布候选版本一再变更,而这个模型也一直在对抗我们为早期 Claude 版本搭建的测试框架。这既令人精疲力尽,又让人兴奋不已。因此,当 Every 纽约团队的部分成员在模型发布当天早上观看了《奥德赛》时,我们立刻意识到了其中的相似之处。向下滚动,即可查看完整的 Vibe Check 以及我们本周发布的所有其他内容。— Kate Lee
知识库
“Claude Opus 5:灵光乍现的天才,实操中的挫败” 作者:Dan Shipper 和 Katie Parrott / Vibe Check :Claude Opus 5 在灵光乍现时堪称天才,但在实际操作中却令人沮丧——它能构建强大的软件,也能连续数小时苦干以消除 Bug,但它发挥出最佳状态的前提,往往要求你先拆掉那些你已依赖的系统。它没有达到 Fable 的上限,也比不上 GPT-5.6 Sol 在日常使用中的顺手。阅读这篇文章,判断 Opus 5 是否值得你为它腾出空间,以及要想用好它,你需要做出哪些改变。
“Every 团队如何用 AI 完成史上最大规模发布” 作者:Laura Entis / Context Window :我们的 All Access 发布活动带来了公司历史上最大的收入增长——两天内大约增长了 9,000 美元。Every 的首席运营官 Brandon Gell 将话筒递给了三位同事,他们是这次创纪录的 All Access 发布背后的建造者——增长工程师 Yash Poojary 、增长主管 Austin Tedesco 和市场营销主管 Douglas Brundage——让他们来详细介绍所使用的工具,以及给所有初学者的建议。观看或收听本期内容,了解一个 AI 原生的团队如何将想法转化为交付的产品。🎧 🖥 在 Spotify 或 Apple Podcasts 上收听,在 YouTube 上观看,或在 X 上 关注讨论。本期内容还包括:OpenAI 的 Romain Huet 和 Dominik Kundel 分享了 Codex 入门指南, Marcus Moretti 通过将任务委托给更便宜的子代理来削减 Fable 的 Token 支出,以及“日常座驾”——一份团队本周正在使用的模型列表——首次亮相。
“为什么有些 AI 工作流能留下来,而另一些不能” 作者:Katie Parrott / Working Overtime :在放弃了一个模仿 Dan 的 Tend 项目而做的“注意力办公桌”克隆品之后,Katie 不再把这当成个人的失败,而是进行了一次事后复盘,探究为什么有些 AI 工作流能留下来,而另一些不能。她发现,一个工作流是存活还是消亡,取决于它对你的时间、精力和心智提出了什么要求,又回馈了什么。阅读本文,了解她用来决定哪些工作流该保留、重新设计、再次审视或直接废弃的四个问题。
“被演示淹没?这里有一种更好的原型设计方法” 作者:Hilary Gridley :AI 让 Hilary 在 Whoop 公司(一家运动和健康穿戴设备公司)的产品团队可以在一个下午就构建出原型——结果他们构建了太多原型,却没有方法区分哪些有用,哪些是噪音。她的论点是,当构建成本变得如此低廉时,原型的任务就变成了测试这个问题是否值得解决,而唯一诚实的评判来自于实际使用它的人,而不是那些对演示做出反应的干系人。阅读本文,看看 Whoop 如何在一个 12,000 人的 Beta 用户群中实践了这一理念。🧑🏫 报名参加 Hilary 在 Maven 上的自定进度课程,如何利用 AI 成为超级管理者,可享受 15% 的折扣。(本文与 Maven 合作制作。)
借鉴这个工作流
Notion 如何用 AI 构建 Notion
Ryan Nystrom,Notion AI 团队的一名软件工程师,在开始编码任务前会先通过口头讲述来梳理。因为当他将一个想法压缩成简短的书面提示时,往往会丢失一些微妙的差别、修正和上下文信息,而口头讲述则让他能把这些都补充进去。
在这个视频中,Ryan 向 Dan 展示了这个口头简报如何变成一个引用了原始资料的 Notion 任务、一个有效的 Pull Request,以及一个能在真人审查代码之前就捕获 Bug 和可维护性问题的审查循环。
- Ryan 口头梳理了一个模型选择器迁移的需求。Notion AI 探索了代码库,并将他的解释转化为了一个附带代码指针、需求、约束条件和验证步骤的任务。
- 他将这个任务交给一个 AI 代理,然后在前端和后端运行了一个自定义的审查集群。这个代理会打开一个 Pull Request,观察测试结果,修复失败项,并在 Ryan 开会期间带着通过测试的代码返回。
以下是你可以开始尝试的方法:
- 在撰写简报之前,先口头梳理工作。解释目标、相关的上下文、约束条件,以及一个完成的结果应该是什么样的。
- 让一个 AI 代理去研究相关的原始资料,并将你的解释转化为一个包含需求和验证步骤的结构化任务。
- 审查计划,然后将任务交给一个能在目标环境中工作的代理。
- 将反复使用的审查标准保存为可复用的技能。Ryan 通过让 Codex 研究已有的技能并将其偏好转化为新技能的方式,构建了他的审查集群。
准备好尝试 Ryan 的工作流了吗?升级到 Every All Access,通过 Builder Pack 为符合条件的工作空间获取六个月的 Notion Business。All Access 成员可以兑换超过 7,000 美元的合作优惠。
来自 Every Studio
Cora 全新的简报体验即将上线
Kieran Klaassen , Cora 的总经理,重建了 Briefed——它用于整理所有非紧急信息的摘要功能——变成了一个双窗格阅读器:左侧是简要信息,右侧打开邮件,就像在收件箱里一样。现在,你可以设置每个类别想要看到多少内容(完整的摘要或简短的片段),给旧的促销邮件和newsletter设置自动清理窗口以便它们自我整理,还可以在不离开简报的情况下批量取消订阅。Kieran Klaassen 已将公开测试版定于 8 月 4 日,届时活跃用户将收到一封邮件和一个入门链接。前往 cora.computer 一探究竟。
Every Agent 能为你浏览网页并自我入职
Every Agent,Every 正在 Slack 中构建的 AI 同事,现在可以代你在公开网站上执行操作:它会登录、填写表单,并在执行任何单向操作(如购物)之前停下来等待你的确认。它现在还能自我入职了。对它回复“yes”,它就会读取你的频道,并识别出它可以帮你分担的三项任务——而且任何团队成员都可以启动这个过程,而不仅仅是安装它的人。Every Agent 目前处于私人 Alpha 阶段,团队正在加强连接,为外部测试做准备。请关注此空间。
校准
专业知识的陷阱。 本世纪最杰出的数学家之一是如何使用 AI 的?
答案很简单。
我打开了 Terence Tao 与 ChatGPT 的对话记录,话题是关于 Fable 针对著名的 Jacobian 猜想——一个困扰数学界长达 87 年之久的难题——提出的反例。我原以为会看到精美、复杂的提示词,可以让我偷师用于自己的 AI 工作。但相反,陶哲轩提出的问题简短而精确,充满了数学术语,并不断追问前沿 AI 模型那些不合逻辑的推理。感觉就像一个 10 岁的天才正在被一位年长得多、也智慧得多的天才教导。
我很快意识到,我可以照搬陶哲轩用过的每一个提示词,但永远,一百万年也不可能复现他所做的事。这种数学魔法只有在一个人对自己的技艺拥有深厚知识时才会发生,因为陶哲轩能做一件非专家做不到的事:评估回复。没有那种专业知识,你根本不知道返回给你的答案是正确的,还是只是看似自信的胡言乱语。
令我恼火的是,我居然相信了那些 LinkedIn AI 网红们像江湖骗子般兜售的“学习 AI”的建议,他们截图展示最新的提示词,承诺能产生“像麦肯锡顾问一样的输出”或“来自世界级 CMO 的增长策略”——仿佛专业知识只是一句你按下回车键就能得到的东西。
从 AI 那里得到一个诱人的答案实在太容易了,我担心我们越来越多的人会退回到“认知卸载”的状态,跳过发展专业知识所必需的艰辛和“被困住”的阶段。在 Anthropic 的一项研究中,52 名主要是初级开发者在学习一个新的 Python 库时,AI 辅助组在随后的测验中得分是 50%,而手工编码组是 67%。两组之间最大的差距在于调试,而这正是当模型出错时发现问题的必备技能。
这只是一项小型研究,而且 AI 也确实可以帮助人们学习。但我现在认为,AI 将使专业知识变得更有价值,同时也使专家变得更难培养。
这不可逆转地改变了我使用 AI 的方式。在阅读它的答案之前,我会强迫自己先厘清我已经理解了什么。有时,在寻求答案之前,我会问:“这里有什么更好的问题?为什么?”机器时刻准备着来救我,但观察陶哲轩,我意识到,专业知识就是在AI没能拯救你的时候,知道这回事的能力。— Ashwin Sharma
核心启示:AI 时代,真正的专业壁垒不在于是否能熟练地发出指令,而在于是否具备深厚的领域知识去评估 AI 的产出;这使专家变得更难培养,也让其价值更加凸显。
“Sometimes You Have to Delete Everything” 的发芽报告
材料核心
这期通讯通过散落在不同栏目中的案例——从 Claude Opus 5 躁郁般的表现、AI 工作流的幸存者偏差、到 Terence Tao 使用 AI 的朴素方式——揭示了一个反直觉的真相:当“造东西”变得无比廉价时,“知道该扔掉什么”反而成了最稀缺、最昂贵的能力。
发芽 01:删除的哲学——混乱作为新秩序的序章
种子
“Claude Opus 5 最出色的工作,往往要求你先拆掉已经依赖的系统。”这句话不仅是 AI 评测,更是一则关于创造的隐喻。 我们通常认为,进步是一层一层往上摞,是累积的、叠加的。但在 AI 原生的工作流里,真正的突破常常需要你先回到原点——把辛苦搭建的“旧架构”一把火烧掉,才能为模型真正擅长的“新结构”腾出空间。这里隐含着一个残酷的假设:你的旧系统不仅是累赘,它本身就是你无法发挥新工具最大潜能的主要障碍。
这让人想起软件工程史上一个著名的极端案例:Netflix 在 2010 年代初期正从 DVD 租赁业务向全球流媒体巨头转型。他们赖以生存的数据中心架构,在当时看来已是业界标杆,但根本无法支撑全球数千万用户同时流畅观看《纸牌屋》的压力。2011 年的一个夜晚,一位工程师在故障中愤怒地喊出一句话:“我们为什么不把这些玩意儿全他妈搞砸,看看它还能不能活过来?” 这句话变成了著名的 Chaos Monkey(混乱猴) 项目。Netflix 没有去打补丁,而是系统性地、持续地在生产环境里随机“删除”服务组件——刻意制造混乱,强迫工程师把系统设计得足够强壮,以至于任何单个部分的崩溃都不会拖垮整体。他们不只是容忍删除,他们把删除变成了一种设计原则。 Opus 5 要求用户的,和 Chaos Monkey 要求 Netflix 工程师的,本质上是同一种勇气:你必须主动摧毁那些令你感到熟悉的、舒适的、过去证明过有效的结构,才能在一个新的韧性层级上重建。没有那场大火,就不会有 AWS 上那个怎么也打不死的 Netflix。
Aha 瞬间
“不要把时间花在让旧模型兼容新代码上——划根火柴,看看什么东西能从灰烬里重新站起来。”
发芽 02:“认知卸载”与专业知识的贵族化
种子
Ashwin Sharma 在通讯的“Alignment”部分提到了一个令人不安的观察:他本想学习 Terry Tao 那样精妙地使用 AI,却发现 Tao 的威力根本不在于 prompt,而在于他那无法被外化的、二十年如一日的苦修所铸就的判断力。AI 能给你答案,但只有在 Tao 手中,它才是解谜的魔杖;在普通人手中,它更像一台生产看上去合理但实际可能一塌糊涂的胡说八道的机器。
这个故事下面藏着一条更深、更危险的线索。心理学中有一个经典概念叫 “Google 效应”(或称数字失忆症,Digital Amnesia),由哥伦比亚大学的 Betsy Sparrow 在 2011 年的一项实验中发现:当我们相信某个信息可以轻易在网上查到时,我们的大脑就会自动放弃记忆这个信息本身,转而只记住“去哪里能找到它”。认知资源被“卸载”了。 现在,把这个逻辑推向极致。当 AI 不只是搜索引擎,而是能为你推理、写作、编程时,卸载的就不再是记忆,而是思考过程本身。Sparrow 时期的那批学生,至少还知道自己忘了什么;而在 AI 时代,更危险的状态是 Terence Tao 所说的那种“自信地输送废话”:一个初级开发者用 AI 生成了代码,他对这个代码的“理解”和“确信”,与代码的真实质量之间被彻底切断了。 这会导致一个可怕的“马太效应”:Terry Tao 这样的大师,用 AI 会变得无比强大,因为他用尖端材料(AI 的输出)盖房子,手里却始终握着一把精准到微米的卷尺(他的专业知识)来丈量每一块砖。而新手,拿着同样一堆尖端材料,手里却没有尺子。他甚至不知道自己需要一把尺子。AI 越是普及,那柄看不见的尺子——深刻的领域知识——就越是成为阶层分化的工具。未来,理解深度的差距,将比信息获取速度的差距,更残酷地划分人的认知阶层。
Aha 瞬间
“AI 没有让专业知识贬值,它只是把知识的作用从‘知道答案’变成了‘知道答案什么时候是在胡说八道’——而后者的门槛比前者高得多。”
发芽 03:西西弗斯、AI 与工作流的“觅食理论”
种子
Katie Parrott 那篇关于 AI 工作流为何有的能坚持、有的被放弃的文章,问了一个所有人都在挣扎的问题:为什么我明明知道 AI 能帮我做这件事,却总是坚持不下去?她的答案是:看这件事从你这里“求取”的(时间、精力、理智)和它“回馈”给你的(价值),能不能达到一个正向的平衡。
这个答案本身,完美地呼应了演化生物学中的一个深刻模型:最优觅食理论(Optimal Foraging Theory)。该理论在 1960 年代由生态学家罗伯特·麦克阿瑟和埃里克·皮亚纳卡提出,核心思想是:动物在觅食时必须不断做出一个决定——我应该继续在这个斑块里刨食,还是奔向另一个资源更丰富的斑块? 这个决定取决于两个变量:一是当前斑块的食物回报率,二是移动到下一个斑块所耗费的时间和能量。Katie 文章里那些被放弃的 AI 工作流,比如那个耗尽心神的“Attention Desk”克隆,其实就是一个“回报正在锐减的觅食斑块”。你继续在这套 prompt 和 check-in 流程里修修补补,就像狼在一片兔子都快被吃完的林子里继续转悠。每一次修改,消耗的都是你的“理智”能量。而 AI 工具世界最残忍的地方在于,放弃的代价被大大降低了——“奔向下一个斑块”,也就是重新设计一套工作流,在今天只是一个下午的事。 这意味着,在 AI 时代,“坚持”这种传统美德,有时可能会变成一种认知陷阱。西西弗斯推石头,是一种悲壮。但如果你今天推的是一块由 GPT 生成的 AI 巨石,而换个方向在别处就有辆自动上坡的 AI 推车等着你……那么,最聪明的策略不是咬牙坚持,而是拎得清:这究竟是值得坚持的命运,还是一个已经应该被重新优化的任务斑块。
Aha 瞬间
“当构建的代价趋近于零时,坚持的美德就必须让位于判断的智慧——最难的代码不是写出来的那行,而是你决定删掉的那万行。”
你的思考空间
- 在你当前正在推进的项目中,哪个“一直运转良好”的系统或信念,其实可能已经是时候彻底推倒重建了?你会如何用一次“受控的爆炸”去测试它的真正韧性?
- 你上一次因为一个 AI 给你的答案看起来太漂亮、太自信,而险些忽略了它实际上是错的,是什么时候?你是如何识破的?你的“尺子”是什么?
- 环顾一下你手头的 AI 工作流,哪些已经变成了让你身心俱疲的“贫瘠觅食斑块”?如果你今天必须放弃其中一个,你会选哪个?放弃之后,你会把省下来的精力投向哪里?