从《Her》里的温柔陪伴,到《普罗米修斯》里冷静执行任务的 David,再到《钢铁侠》里能理解上下文、调度系统、辅助决策的贾维斯,科幻作品一直在想象同一个问题:
真正自然的人机协作,应该是什么样子?
它不应该只是聊天框里的命令输入,也不应该只是机器朗读答案。更理想的状态是:AI 能通过语音进入工作流,听得懂上下文,接得住变化,也能把复杂任务交给更专业的系统完成。
但今天和 Agent 协作,很多时候仍然很“键盘时代”:打一段话,等它执行;再补一句,再等一次。
我们希望它更像一个能随时沟通的协作者——你可以边说边想,它可以边听边干活。
于是有了这个项目:Qwen-Audio-Agent,一个开源的实时语音的 Harness 系统。
开源地址:https://github.com/QwenAudio/qwen-audio-agent
它不是要替代 OpenCode、OpenClaw、Qoder、Hermes、CodeBuddy、Codex 这些 Agent,而是给它们加上一个统一的实时语音入口。你可以像打电话一样和 Agent 连续说话,随时打断,也可以把更复杂的任务委派给后台 Agent 去执行。
它解决的核心问题
传统 Agent 交互里,用户很容易被任务阻塞。比如你说:
帮我把这个项目的 README 改一下,再跑一下测试。
Agent 开始工作后,你通常只能等。如果中途你突然想补充一句:
对了,英文版也要同步改一下。
很多系统要么插不进去,要么上下文乱掉,要么必须等上一个任务完全结束。但真实工作不是这样的。真实工作更像这样:
- 你一边讲需求,一边看结果;
- Agent 一边执行任务,一边把进展和结果带回对话;
- 你可以随时打断、补充、换方向。
Qwen-Audio-Agent 想做的,就是把这种协作方式变成现实。
项目架构
Qwen-Audio-Agent 位于用户和后台 Agent 之间。用户面对的是一个实时语音前台。简单问题可以即时回答;复杂任务会交给后台 Agent。
后台 Agent 可以是 OpenCode、OpenClaw、Qoder、Hermes、CodeBuddy、Codex,也可以通过通用 ACP 入口继续接入更多 Agent。它们负责真正深入的工作:搜索、推理、写代码、改文件、处理项目、操作工具。而 Qwen-Audio-Agent 负责让这些能力以更自然的方式进入实时对话。
整体架构如下图所示:

用户与实时语音组件进行自然聊天和即时回答;当需要更深入的工作(如搜索、推理或更具智能体特性的能力)时,系统会将 context 委派给 Agent Runtime 执行,并将 response 带回当前对话。
这个设计和 GPT-Live、Thinking Machines Interaction Models 的方向有点异曲同工。OpenAI 在介绍 GPT-Live 时,把核心拆成两件事:一是全双工,让语音模型能够边听边说;二是当问题需要搜索、深度推理或更复杂的智能体任务时,把任务委派给后台更强的模型去处理,完成后再把结果带回当前对话。更进一步,GPT-Live 目前已经集成进最新版本的 Codex,你在闲聊的过程中,就能让它帮你处理多个项目里的任务。
核心能力
1. 全双工实时语音:更接近自然交流的实时交互
全双工实时语音是 Qwen-Audio-Agent 最具代表性的能力之一。它不是“按住说一句,等它回一句”的语音助手,而是支持连续说话、自然打断,并在 Agent 工作过程中继续补充需求的实时交互方式。比如:
帮我看一下这个项目怎么启动。
等等,先别改代码,先讲一下问题原因。
好,那现在你帮我修一下。
顺便把测试也跑了。
如果失败了,直接继续排查。这类连续多轮交互,用文字当然也能做,但成本更高。语音的优势在于:它更轻、更快,也更接近我们真实协作时的状态。一句话总结就是——边聊边干活,效率和情绪价值都拉满。
2. 接入主流 Agent 生态,并持续扩展
Qwen-Audio-Agent 不是重新造一个全新的 Agent。它更像一个“语音入口层”。你已经在用的 Agent,不管是 OpenCode、OpenClaw、Qoder、Hermes、CodeBuddy,还是 Codex,都可以接入到同一个实时语音前台里。其他支持 ACP stdio 协议的 Agent,也可以通过通用 ACP 入口扩展。
当前支持的后台 Agent:
| 后台Agent | 状态 | 主要能力 | 推荐指数 |
| OpenCode | ✔ | 工具与代码任务、项目Session、进度查询与取消 | ★★★★★ |
| OpenClaw | ✔ | Agent、工具、任务执行与权限控制 | ★★★★★ |
| Qoder | ✔ | 原生CLI Session、新建或继续项目、任务委派与取消 | ★★★★★ |
| Hermes | ✔ | 原生ACP、工具调用、项目Session与任务执行 | ★★★★☆ |
| CodeBuddy | ✔ | 原生ACP、自定义模型、项目Session与权限控制 | ★★★★☆ |
| Codex | ✔ | Codex ACP、代码任务、项目Session与权限控制 | ★★★★☆ |
这件事很重要。因为每个 Agent 背后都有自己的模型、工具、权限、项目上下文和执行方式。 如果重新做一套,成本高,也很难复用用户已有的工作流。Qwen-Audio-Agent 的思路是:不要替代它们,而是让它们开口说话。后台 Agent 继续负责自己擅长的任务执行。Qwen-Audio-Agent 负责实时语音、任务委派、上下文衔接和结果播报。这让它更像一个面向 Agent 生态的实时语音前台。
快速开始
安装:
npm install -g qwen-audio-agent
创建配置:
qwenaudio config
填写 DashScope API Key,并选择后台 Agent,例如 OpenCode:
DASHSCOPE_API_KEY=your-key
AGENT_PROTOCOL=opencode
启动TUI,或者打开WEBUI:
qwenaudio tui
qwenaudio webui
如果从源码体验 macOS 桌面版,在项目目录启动:
npm install
npm run desktop
桌面版提供常驻桌面的语音悬浮球,适合放在屏幕角落,需要时直接说话。它支持流光声波球和液态渐变球两种外观。
关乎未来
Agent 的能力还会继续变强:模型更强,工具更多,任务也会更复杂。但真正影响体验的,可能不只是“它能做什么”,还有“人怎么和它协作”。
文字输入足够精确,但不够轻。传统语音助手足够自然,但很难深入执行任务。Qwen-Audio-Agent 想连接这两端:用实时语音承接自然交流,用后台 Agent 完成深入工作。
从《Her》到贾维斯,科幻作品里最打动人的从来不只是“AI 很聪明”,而是它终于能以一种自然的方式参与人的生活和工作。
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。