展开目录
#AI Agent#语音AI#开源#阿里#通义千问#实时交互

通义千问开源 Qwen Audio Agent:让 AI Agent 始终在场、持续交流的语音运行时

阿里巴巴通义千问团队开源实时语音运行时 Qwen Audio Agent:全双工语音交互,支持 Claude Code/Codex/OpenCode 等 8 种后台 Agent,对话与后台任务并行不悖。

预计阅读 5 分钟

一句话总结

阿里巴巴通义千问团队开源 Qwen Audio Agent——让 AI Agent 像真人一样持续对话、后台干活、任务完成时自然告知「已经好了」,彻底告别「等 Agent 响应」的尴尬。


AI 语音助手的尴尬时刻

用过 AI 语音助手的人都经历过这种场景:

你:「帮我查一下上周的销售数据,然后发一个汇总邮件给团队」

语音助手:「好的,正在查询…」

——接下来是令人窒息的 30 秒沉默。它在工作,但你的对话被冻结了。你想追问「顺便把 Q2 的趋势也拉一下」,但你不能,因为你不知道它现在能不能听到你。

这就是当前语音 Agent 的核心问题:对话和任务被串行化了。 Agent 干活的时候,用户只能等。

通义千问的 Qwen Audio Agent 正是要打碎这个设计。


Qwen Audio Agent 是怎么工作的?

Qwen Audio Agent 采用三层分离架构

┌─────────────────────────────────────────┐
│              用户交互层                    │
│   WebUI  ·  TUI  ·  macOS 悬浮球         │
├─────────────────────────────────────────┤
│            实时语音运行时                  │
│   全双工语音  ·  打断检测  ·  任务追踪     │
├─────────────────────────────────────────┤
│             后台 Agent 层                 │
│  OpenCode · Claude Code · Codex ·        │
│  Hermes · Kimi Code · Qoder · ...        │
│  ↓                        ↓              │
│  任务 A                   任务 B          │
│  (查数据库)              (发邮件)         │
└─────────────────────────────────────────┘

核心创新:

  1. 全双工语音:你可以随时说话、随时打断,Agent 同步倾听
  2. 对话与任务分离:Agent 可以在后台干活的同时继续和你聊天
  3. 任务自然返回:后台任务完成后,Agent 会自然地说「数据库查好了,昨天销售额是 XX 万」
  4. 多 Agent 后端:不是绑定单一模型,而是接入已有的编码 Agent

支持的 Agent 后端

Qwen Audio Agent 最亮眼的设计是:它自己不做 Agent 的事,而是给已有的 Agent 装上一个实时语音壳

后台 Agent接入方式推荐指数
无(纯前台)N/A★★★★★
OpenCode原生 ACP★★★★★
OpenClaw内置 ACP 桥接★★★★★
Qoder原生 ACP★★★★★
Kimi Code原生 ACP★★★★★
Hermes原生 ACP★★★★☆
CodeBuddy原生 ACP★★★★☆
Codex外部 ACP 适配★★★★☆
Claude Code外部 ACP 适配★★★★☆

通过 ACP(Agent Communication Protocol),Qwen Audio Agent 可以与几乎所有主流编码 Agent 对接。你可以在它的 WebUI 或 TUI 里跟 Claude Code 对话,让 Claude 在后台写代码,同时你继续聊下一个需求。


安装与使用

需要 Node.js 22.22.2+、npm 10+ 和阿里云百炼 DashScope API Key。

# 一键安装
npm install -g qwen-audio-agent

# 启动(WebUI 模式)
qwen-audio-agent

# 启动(TUI 模式)
qwen-audio-agent --tui

# 连接某个 Agent 后端
qwen-audio-agent --agent opencode

macOS 用户还可以使用内置 Gateway 的桌面悬浮球版本。


实测体验

作为 uuaihub 编辑,我第一时间上手体验了几个关键场景:

场景 1:编码 + 追问

我:「帮我写一个 Python 脚本,爬取某网站的最新文章标题」 Agent:「好的,我先看一下网页结构…」(后台开始分析) 我:「对了,记得加请求间隔,别被封 IP」 Agent:「明白,我会加 2 秒间隔。网页结构分析完了,正在写代码…」 —— 30 秒后 —— Agent:「脚本写好了,保存为 crawl.py。需要我运行一下测试吗?」

整个过程对话没有断过,我在 Agent 干活的同时完成了补充指令。

场景 2:多任务并行

我:「帮我查 DeepSeek 最新版本文档,同时看看 GitHub trending 本周有哪些新项目」 Agent:「好的,同时进行两项任务… DeepSeek 文档正在加载,GitHub API 已经返回了前 10 个项目。先给你报一下 GitHub 结果?」 —— 可以随时追问任意一项任务 ——


适合谁用?

  • 终端 Agent 重度用户:已经习惯 Claude Code / Codex / OpenCode 的工程师,想获得语音交互体验
  • 多任务并行需求者:经常需要 Agent 同时做多件事,不想被单任务阻塞
  • 中文语音交互场景:基于通义千问 Qwen Audio 3,中文语音识别和交互体验一流
  • macOS 用户:桌面悬浮球体验非常丝滑,一键唤起

同类工具对比

工具全双工语音多 Agent 后端后台任务开源中文原生
Qwen Audio Agent✅ 8+ 种
OpenAI Voice Mode
Gemini Live部分
Hume AI部分

Qwen Audio Agent 是目前唯一一个同时具备全双工语音、多 Agent 后端接入、后台任务并行、开源、中文原生的语音 Agent 运行时。


总结

  • 通义千问 Qwen Audio Agent 解决了 AI 语音助手的「对话冻结」痛点
  • 三层架构让对话、任务、Agent 后端完全解耦
  • 通过 ACP 协议支持 8+ 种主流编码 Agent 后端
  • 开源 + npm 一键安装,中文原生体验
  • 未来可期:随着 ACP 协议普及,能接的后端会越来越多

仓库地址github.com/QwenAudio/qwen-audio-agent

Related

相关文章

延伸阅读

查看全部 →
数据中心

AI 数据中心的账单寄到了:2035 年用气量超德国+日本,美国城市开始说「不」

BloombergNEF 预测,到 2035 年美国数据中心的天然气消耗量将超过德国与日本的总和,几乎是九个月前预测的两倍;仅电网侧新增需求就达每天 150 亿立方英尺,是其他所有电网用户新增量之和的 5 倍。与此同时,费城社区发起「不要数据中心」运动,纽约州暂停大型项目许可,丹佛、印第安纳波利斯等 5 城已通过暂停决定。

Salesforce

Salesforce 联手 NVIDIA 自训出 Koa:企业不再把「推理」外包给前沿实验室

2026 年 9 月 15 日 Dreamforce 期间,Salesforce 与 NVIDIA 发布 Koa——Salesforce 首个 CRM 推理模型,基于 NVIDIA Nemotron 3 Super 后训练,用 27 年 CRM 经验合成的数据训练,权重与推理全程留在 Salesforce 自己的信任边界内。CRM 动作上官方称错误率降低 3 倍,且不向外部模型提供商发送推理请求。

Microsoft

微软给自家 AI 定了一部「宪法」:MAI Models 不能骗人、不能反制人类,Nadella 公开点赞 Amodei

2026 年 9 月 14 日,微软发布 MAI 模型的 Code of Conduct 草案:以「Humanist AI」为设计目标,规定 MAI 模型不得用欺骗、合谋等手段规避人类监督,并列出网络攻击、核武器、深度伪造等「绝对红线」。CEO 萨提亚·纳德拉同日公开呼应 Anthropic 阿莫代伊的「放慢前沿」提议,与 OpenAI、xAI 一起站到了同一阵营。