用语音加速构建

原文:https://every.to/guides/build-faster-with-voice


将语音融入工作流的两种方式

我认为语音进入工作流程主要有两种方式:

主动协作发生在你正在工作时,你清楚想让语音帮助你完成什么。你可以在智能体编辑草稿或排查漏洞时与之对话,或者在 Gmail 中语音输入邮件,在 Slack 中口述消息。这也是我开发 Monologue(Every 旗下的语音听写应用)时所围绕的核心初始用例。

主动协作也可以以持续对话的形式展开。像 GPT-Live 这样的新语音模型,能听也能同时说话,允许你打断、调整方向并追问后续问题。在处理更复杂的工作时,GPT-Live 可以把任务发送给另一个后台模型,同时继续与你交谈,待结果就绪后再返回给你。

我在 Every 的同事已经在这样工作了:Dan Shipper 最近就利用 GPT-Live 来撰写和修订一篇长文。

通俗点说,语音听写在你清楚自己要说什么、以及文字该放在哪里时很有用;而实时对话则在你需要提问并当场修正时效果更好。这两种情况下,你都是在工作的同时进行表达,而非先录下来稍后处理。

若想一睹这种工作方式的实际应用,欢迎参加我们的语音模式训练营。这是一节一小时的在线课程,Every 团队将现场演示在写作与智能体编排方面的实用语音工作流,帮你快速上手并解答你的疑问。

被动捕捉则发生在你还不知道那些话语该归属于何处之前。你可能在散步时录制一些自己的思考片段、一次全员会议上的问答环节,或是一系列客户通话,并把这些全部存下来,作为日后挖掘的素材。这些录音可能会持续很久,并且会在不同的话题或想法之间来回切换;内容的整理是之后的事。我设计了 Monologue Notes(可通过 Monologue 在 Mac、iOS 和 watchOS 上的应用获取),正是为了这类被动捕捉。Monologue Notes 能录制并转写会议、通话及各种碎片化思绪,并将它们保存在一个可搜索的存档中。随后,Codex、Claude 或其他智能体就能从中检索出相关上下文,将其转化为草稿、计划、决策或代码变更。

智能体语音循环

根据我自己的工作经历以及同事们分享的案例,几乎每个实用的语音工作流都遵循相同的五个步骤。在处理已录制音频时,这些步骤可能会跨越数小时甚至数天;而在协作场景中,它们可以随着你的交谈而重叠和反复出现。

捕捉 → 添加上下文 → 界定产出 → 执行 → 审查与重定向

  • 捕捉原始素材。 一边工作一边口述,或者录制会议、通话及思绪。请允许自己保留那些你在邮件中可能会删掉的旁支末节和细节。智能体之后可以对所有内容进行筛选或整理。

  • 添加上下文。 当你对 Codex、Claude Code 或其他应用中的智能体说话时,你的话语会成为当前工作会话的一部分。如果你需要的是更早录制的关联内容,请粘贴或上传转写文本,也可以将智能体连接到你的笔记存档,使其能直接检索。智能体可能还需要访问相关的代码库、待解决问题的列表、Slack 讨论串、Notion 文档或邮件往来。引导它找到正确的信息源,并让它告诉你是否无法访问某些内容。在实时会话中,它可以在对话持续进行时检索这些辅助性的上下文。

  • 界定产出。 首先,告诉智能体你想要它生成什么,无论是漏洞补丁、文章大纲、邮件草稿、市场进入简报,还是网站改动。接着,明确指出产出应投放至何处——例如特定的代码项目、Google 文档、Slack 频道或 Linear 项目。

  • 执行任务。 智能体会搜索、读取、编写并运行必要的工具。如果你正在和它实时协作,它可以在对话继续进行的同时汇报进度或暴露障碍,你也能在它完成前随时打断。

  • 审查,必要时重定向。 评估智能体处理任务的方式:它找对了录音吗?访问了正确的资源吗?完成了任务吗?然后检查具体结果。这可能包括补丁的测试项和代码改动、一封邮件的语调,或是市场进入计划的架构。纠正任何错误的假设或缺失的上下文,并让智能体再次尝试。

以那段 19 分钟的客户通话为例,整个循环看起来大致如此:录制通话,让 Codex 检索转写文本,将智能体指向相应的代码库,并要求它给出问题诊断及有针对性的修复方案。在实时会话中,你可以在 Codex 排查问题时持续与之交谈,并实时纠正它的假设。

知道该说什么

一段口头简报通常应包含三件事:你正在进行的项目、在哪里可以找到额外上下文,以及你希望智能体产出的内容。

这三个要素通常足以应对即便是复杂的项目了。在为Every的订阅者举办了一场线上活动之后,Austin Tedesco 将活动录音及聊天记录上传到 Codex,告诉它去翻阅相关的 Slack 讨论串和 Notion 文档,然后用 Monologue 给出了一段口头简报,说明他想创建的后续物料——包括一个包含活动录像和转写文本的配套资料库,以及一封发给参会者的后续邮件。

可以直接套用的口头简报模板:

模板

当前情况是:[情境、观察或问题]。

请从以下位置获取更多上下文:[笔记、转写文本、讨论串、文件夹、仓库或已连接的某个系统]。

我希望你生成:[产物形式],交付给 [人员、工具或目的地]。

限制条件:[需要遵守的规则、可变更范围的约束、截止日期]。

将你的笔记和转写文本连接到智能体

将你的 AI 笔记工具连接到你的智能体,意味着你可以通过“调取上周二的客户通话记录”或“本月所有关于用户引导环节的笔记”等指令来访问转写文本,并将它们与你的代码库、Slack、Notion、邮件或其他关联工具的上下文进行整合。

这种连接让被动捕捉变得切实可行。你可以在还不确定信息归属于何处之前就进行录制,相信你的智能体会在相关内容变得有意义时替你把它翻出来。

要把你的 AI 笔记应用连接到智能体上,请寻找以下几种接入点之一:

  • 内置的连接器或模型上下文协议(Model Context Protocol)服务器: 在你的智能体中选中该应用,并授权访问。
  • API 或命令行接口(CLI): 安装该应用的工具,让智能体能够运行搜索和检索录音的命令。
  • 同步文件夹或自动导出: 让智能体有权访问存放转写文本的文件夹。

不管你选择哪种方式,都要测试一下智能体是否能按日期或主题找到录音,并获取完整的转写文本。(要知道,智能体非常擅长从海量上下文中挖掘要点,而 AI 生成的摘要有可能是错的,或者漏掉关键细节。)

Monologue 通过 Monologue 工具包支持智能体直接访问。该工具包包含一个只读命令行(CLI)工具,可以列出、搜索并检索笔记、摘要和转写文本。它还包括一项 monologue-notes 技能,用来教 Codex、Claude Code 以及其他能运行终端的智能体使用这些命令。

在 Codex 或 Claude Code 中设置 Monologue

你可以让你的智能体来处理安装过程。打开 Codex 或 Claude Code,粘贴以下指令:

指令

请使用官方工具包为我设置 Monologue Notes:

https://github.com/EveryInc/monologue-toolkit

请阅读当前的 README 文件。告诉我你计划运行哪些命令,等到我批准后,再安装 Monologue CLI 和全局的 monologue-notes 技能。

不要要求我把我的 Monologue API 密钥粘贴到这个聊天框里。当需要身份验证时,你暂停下来,并告知我如何在 Monologue 应用中创建个人 API 密钥,以及我自己运行 monologue onboarding 命令。

在我确认配置完成后:

  1. 用 monologue notes list --limit 5 来验证连接。
  2. 确认 monologue-notes 技能已安装。
  3. 告诉我你安装了哪些东西,以及它们位于何处。
  4. 提供一个我可以用来测试笔记检索的自然语言问题。

不要在聊天记录或项目文件中显示、复制或存储我的 API 密钥。

当智能体暂停后,在 Mac 上打开 Monologue,前往 设置(Settings)→ 笔记(Notes)→ API。创建一个个人 API 密钥。然后打开终端(Terminal),运行 monologue onboarding 命令,并将密钥粘贴到终端的提示符中。你只需认证一次。

智能体验证连接成功后,试试这个:

指令

使用 monologue-notes 技能,找到我最新的那条笔记。告诉我它的标题、日期和一句话摘要,并指出你用的是哪条笔记。

一旦成功运行,你就能通过自然语言请求来访问你所有的录音,智能体将负责完成检索工作。

这份指南面向付费订阅者

升级你的会员资格,继续阅读完整指南。

订阅以继续

语音工作流库

指南之工作流

思考与规划

指南之工作流

构建

指南之工作流

沟通

指南之工作流

活的记忆系统

指南之工作流

两个能迅速见效的语音小技巧

指南之工作流

重复三遍?那就存下来。

指南之工作流


核心启示:将语音从单纯的“输入工具”升级为一套完整的“人机协作系统”,关键在于区分“主动协作”与“被动捕捉”这两种场景,并建立“捕捉素材—添加上下文—界定产出—智能体执行—人类审查重定向”的标准化工作循环,才能真正让语音成为可信赖的开发与创作加速器。

Build Faster With Voice 的发芽报告

材料核心

这篇文章提出了一套将语音融入AI代理工作流的系统方法论,区分了“主动协作”和“被动捕捉”两种模式,并提炼出一个五步的代理语音循环(Capture → add context → define outcome → act → review)。核心洞察是:真正高效的语音工作不是简单的听写,而是建立一个“不成熟思考也可被系统回收利用”的人机协作基础设施。


发芽 01:主动协作——当指令优于操作

种子

文章的“主动协作”模式揭示了一个微妙转变:人类从“执行者”变成了“导演”。你不再需要通过逐字逐句地输入来完成工作,你只需要知道自己想要什么结果,并能够清晰地叙述这个结果、它的上下文和约束条件。

但这里有一个被低估的张力——说清楚指令本身也是一种高难度认知活动。能够流畅地说出一个需求的全部边界条件、资源位置和验收标准,实际上要求你对问题已经有了相当深度的理解。这与“边做边想、在操作中涌现洞见”的传统工作模式存在根本性的冲突。

问题的转向在于:人类大脑的推理速度远快于表达速度。当我们“说”出一个指令时,大脑必须完成从“模糊意向”到“结构化语言”的跨越。而AI代理的优势在于,它只需要这个结构化语言的“种子”,就能自动补全上下文并执行。这其实是认知分工的再分配:人类负责推理和决策,机器负责操作和上下文聚合。

故事主体

海明威有一个著名的“冰山理论”:好的作家只需要写出水面上的八分之一,水下的八分之七留给读者去推断。他在《午后之死》中写道:“如果一位散文作家对于他想写的东西心里很有数,那么他可以省略他所知道的东西;读者会强烈地感觉到他所省略的地方,好像作者已经写出来似的。”

这恰好解释了为什么“主动协作”能在AI代理语境下高效运作。当Dan Shipper用GPT-Live写稿时,他实际上只需要说出关键指令点——调整段落结构、检查论证链条、改写过渡句——而GPT-Live则通过“推理即执行”的方式,推断出完整的目标稿样应该是什么形态。

更重要的是,这种模式改变了“创作中断”的性质。传统写作中,当你需要停下来润色一个段落时,你不仅离开了逻辑流,还离开了时间流。回来看草稿时,之前的思维轨迹已经冷却。而语音指令允许你“在流中纠正”——思维不中断,只是换了一个输出模态。这背后的原理和流心流理论(flow theory)中的“即时反馈”条件高度吻合:延迟越短,状态的维持成本越低。

这里出现的关键认知是:人类应该把最擅长的事(评判、纠偏、建立意义框架)留给自己,把需要横向关联和大量检索的事(翻对话记录、查代码仓库、对齐邮件线程)交给代理。不是因为后者“低级”,而是因为后者的空间跨度超过了人类的工作记忆容量。语音协作的真正价值不在于“快速”,而在于实现了“推理在时间上的不间断”。

Aha 瞬间

“人类负责冰山的水面上层,AI代理负责水下——但区别在于,AI可以瞬间冻结并分析整座冰山,而人类只需决定冰山朝哪个方向漂。”


发芽 02:被动捕捉——把不成熟的思考变成延迟资产

种子

文章强调“被动捕捉”时说了很重要的一点:你可以在“不知道信息将去向何方”时就记录它,信任代理会在未来某个相关时刻把它提取出来。

这表面上是给“笔记系统”增加了语音入口,但实际上它重新定义了“思考”的时间边界。在传统的知识管理中,你记录一个想法时已经预设了它的用途(比如这个灵感属于某个项目、某个文章大纲的某个小节)。但在被动捕捉模式下,你会记录一段散步时的喃喃自语,却不知道它会在什么时间、以什么方式被触发和利用。这种“意图延后”打破了GDT的“收集-处理-执行”线性流水线。

这带来一个隐含的高阶能力:你开始把思考当成一种可以“离线投资”的活动。你的大脑被解放去获取灵感,而不是忙于记忆和组织。

故事主体

设计师和发明家巴克敏斯特·富勒有一个习惯:他会在任何地方、任何时间记录自己的想法,从不筛选。他称这些记录为“chronofile”,并按时间严格归档。终其一生,他积累了超过270英尺(约82米)的档案材料。据估算,他从1915年到1983年间,每15分钟归档一次,形成了一个覆盖他整个人生的“思维化石层”。

富勒生前并没有完整利用这些档案来指导具体项目——他更多视之为一种存在性实践。但在今天回看,他的chronofile 完美诠释了被动捕捉的终极形态:记录的意义不在于当下的有用性,而在于构建一个可以被“事后查询”的认知存储层。AI代理的出现正是让这种存储层变成了可激活的资产。以前你需要手动翻查笔记去寻找“去年春天我在公园说的那段话”,现在你只需要说:“找到我所有提及‘重复使用’的录音片段,并对比它们之间的观点流转。”

这种转变还触及认知科学中的一个概念——识别记忆与回忆记忆的区别。心理学研究表明,人类大脑更擅长识别("Yes, that's the right one"),而不是无提示的自由回忆("List everything you know about this")。被动捕捉加代理检索,恰好把回忆负担转化为识别判断:你给代理一个模糊线索,它反馈多个可能的结果,你只需确认和选择。整个过程更符合大脑的自然运作模式。

回到文章中的19分钟客户电话场景,录音的价值不在于当下能从中得到什么,而在于它嵌入了一个上下文感知系统:当你一周后面临同样的bug报告时,代理已经从那段录音中提取了相关线索,并结合代码库告诉你“这是上次客户提到的边缘情况”。人类完成了一次时间的折叠。

Aha 瞬间

“以前,不成熟的思考是废料;现在它们变成了休眠的知识酵母,只等一个触发条件就苏醒。”


发芽 03:五步循环的真正重心——从“执行-审核”到“意图-推理”的转移

种子

文章中列出的五步代理语音循环(Capture → Add context → Define outcome → Act → Review and redirect)看起来像是一个标准的项目管理闭环,但仔细看会发现:前三步(录制、加上下文、定义结果)占据了人类注意力的绝对主体,而第四步和第五步是“机械性审核”——即检查代理的工作是否对齐了你的意图。

这意味着核心重心已经从“如何做”转移到了“要做什么和为什么”。传统的软件工程或写作流程中,“执行”通常是最大的消耗(编码、写作、排版),而审核是二次消耗(审查代码、修改文章)。但在这个循环中,执行是一次性的(代理自动完成),而审核变成了“重新校准意图”的元活动。

这带来了一个被低估的风险:当执行变得足够轻量级时,人类可能会不自觉地进入“意图通胀”——不断产出新的需求,因为产出需求的成本太低。大脑的奖励回路可能会被“下达指令并看到结果”这个反馈循环劫持,导致决策密度过高、反思深度不足。

故事主体

这个风险在军事指挥的历史上有一个经典对照。普鲁士军事改革家老毛奇在19世纪提出“任务式指挥”原则:高级指挥官只向下级指挥官传达“任务目的”(what to achieve and why),而不指导具体执行方法(how)。这个原则极大地提升了前线自主性和响应速度,成为现代军事指挥的基石。

但它的致命弱点,在老毛奇的时代就已经显现:如果高级指挥官频繁改变任务目的(因为“决策成本太低,只需发一封电报”),前线就会陷入目标混乱。在1866年的普奥战争中,部分普鲁士部队因为接收了多封相互矛盾的指示而错失战机。问题不在于任务式指挥本身,而在于意图的变异性。

这个类比直接映射到今天的语音代理工作流:当“说一句话就能生成一篇大纲、修订一段代码”时,人类的意图颤动就会变得极为频繁。你可能在五分钟内下达、修改、再修改十个指令,不断改变方向,最终生成的不是工作计划,而是“命令沙堆”——一个随时可能崩塌的复杂指令链。

解决方案隐藏在老毛奇的原则深处:意图必须稳定。文章最后的Review and redirect环节,本质上就是把审核和重定向的权利重新拉回到人类一侧,要求人类在审查结果时,不仅是检查代理的“对错”,更要追问自己的“是否合理”。这不是质量控制流程,而是意图理性的护栏

Aha 瞬间

“当执行的摩擦力趋近于零时,意图本身变成了唯一的阻力面——而阻力面越大,方向感越清晰。”


你的思考空间

  • 当你用语音命令代理去完成一项任务时,你是先理清了完整的步骤,还是边试边修正?这个过程中,你的大脑在“说之前”和“说之后”的认知状态有什么差异?
  • 被动捕捉的信任前提是“未来某个时刻,代理能帮你找到正确的内容”。但哪些类型的思考会被这种信任机制永久遗忘——因为它们的意义只能在未记录的空隙间浮现?
  • 意图通胀如果变成常态,会不会导致一种新的生产力假象:你觉得自己推进了很多事,但实际上只是在不同版本的“快速原型”之间切换,从未真正纵深到一个问题上?