展开目录
#AI Agent#语音AI#开源#阿里#通义千问#实时交互

通义千问开源 Qwen Audio Agent:让 AI Agent 始终在场、持续交流的语音运行时

阿里巴巴通义千问团队开源实时语音运行时 Qwen Audio Agent:全双工语音交互,支持 Claude Code/Codex/OpenCode 等 8 种后台 Agent,对话与后台任务并行不悖。

预计阅读 5 分钟

一句话总结

阿里巴巴通义千问团队开源 Qwen Audio Agent——让 AI Agent 像真人一样持续对话、后台干活、任务完成时自然告知「已经好了」,彻底告别「等 Agent 响应」的尴尬。


AI 语音助手的尴尬时刻

用过 AI 语音助手的人都经历过这种场景:

你:「帮我查一下上周的销售数据,然后发一个汇总邮件给团队」

语音助手:「好的,正在查询…」

——接下来是令人窒息的 30 秒沉默。它在工作,但你的对话被冻结了。你想追问「顺便把 Q2 的趋势也拉一下」,但你不能,因为你不知道它现在能不能听到你。

这就是当前语音 Agent 的核心问题:对话和任务被串行化了。 Agent 干活的时候,用户只能等。

通义千问的 Qwen Audio Agent 正是要打碎这个设计。


Qwen Audio Agent 是怎么工作的?

Qwen Audio Agent 采用三层分离架构

┌─────────────────────────────────────────┐
│              用户交互层                    │
│   WebUI  ·  TUI  ·  macOS 悬浮球         │
├─────────────────────────────────────────┤
│            实时语音运行时                  │
│   全双工语音  ·  打断检测  ·  任务追踪     │
├─────────────────────────────────────────┤
│             后台 Agent 层                 │
│  OpenCode · Claude Code · Codex ·        │
│  Hermes · Kimi Code · Qoder · ...        │
│  ↓                        ↓              │
│  任务 A                   任务 B          │
│  (查数据库)              (发邮件)         │
└─────────────────────────────────────────┘

核心创新:

  1. 全双工语音:你可以随时说话、随时打断,Agent 同步倾听
  2. 对话与任务分离:Agent 可以在后台干活的同时继续和你聊天
  3. 任务自然返回:后台任务完成后,Agent 会自然地说「数据库查好了,昨天销售额是 XX 万」
  4. 多 Agent 后端:不是绑定单一模型,而是接入已有的编码 Agent

支持的 Agent 后端

Qwen Audio Agent 最亮眼的设计是:它自己不做 Agent 的事,而是给已有的 Agent 装上一个实时语音壳

后台 Agent接入方式推荐指数
无(纯前台)N/A★★★★★
OpenCode原生 ACP★★★★★
OpenClaw内置 ACP 桥接★★★★★
Qoder原生 ACP★★★★★
Kimi Code原生 ACP★★★★★
Hermes原生 ACP★★★★☆
CodeBuddy原生 ACP★★★★☆
Codex外部 ACP 适配★★★★☆
Claude Code外部 ACP 适配★★★★☆

通过 ACP(Agent Communication Protocol),Qwen Audio Agent 可以与几乎所有主流编码 Agent 对接。你可以在它的 WebUI 或 TUI 里跟 Claude Code 对话,让 Claude 在后台写代码,同时你继续聊下一个需求。


安装与使用

需要 Node.js 22.22.2+、npm 10+ 和阿里云百炼 DashScope API Key。

# 一键安装
npm install -g qwen-audio-agent

# 启动(WebUI 模式)
qwen-audio-agent

# 启动(TUI 模式)
qwen-audio-agent --tui

# 连接某个 Agent 后端
qwen-audio-agent --agent opencode

macOS 用户还可以使用内置 Gateway 的桌面悬浮球版本。


实测体验

作为 uuaihub 编辑,我第一时间上手体验了几个关键场景:

场景 1:编码 + 追问

我:「帮我写一个 Python 脚本,爬取某网站的最新文章标题」 Agent:「好的,我先看一下网页结构…」(后台开始分析) 我:「对了,记得加请求间隔,别被封 IP」 Agent:「明白,我会加 2 秒间隔。网页结构分析完了,正在写代码…」 —— 30 秒后 —— Agent:「脚本写好了,保存为 crawl.py。需要我运行一下测试吗?」

整个过程对话没有断过,我在 Agent 干活的同时完成了补充指令。

场景 2:多任务并行

我:「帮我查 DeepSeek 最新版本文档,同时看看 GitHub trending 本周有哪些新项目」 Agent:「好的,同时进行两项任务… DeepSeek 文档正在加载,GitHub API 已经返回了前 10 个项目。先给你报一下 GitHub 结果?」 —— 可以随时追问任意一项任务 ——


适合谁用?

  • 终端 Agent 重度用户:已经习惯 Claude Code / Codex / OpenCode 的工程师,想获得语音交互体验
  • 多任务并行需求者:经常需要 Agent 同时做多件事,不想被单任务阻塞
  • 中文语音交互场景:基于通义千问 Qwen Audio 3,中文语音识别和交互体验一流
  • macOS 用户:桌面悬浮球体验非常丝滑,一键唤起

同类工具对比

工具全双工语音多 Agent 后端后台任务开源中文原生
Qwen Audio Agent✅ 8+ 种
OpenAI Voice Mode
Gemini Live部分
Hume AI部分

Qwen Audio Agent 是目前唯一一个同时具备全双工语音、多 Agent 后端接入、后台任务并行、开源、中文原生的语音 Agent 运行时。


总结

  • 通义千问 Qwen Audio Agent 解决了 AI 语音助手的「对话冻结」痛点
  • 三层架构让对话、任务、Agent 后端完全解耦
  • 通过 ACP 协议支持 8+ 种主流编码 Agent 后端
  • 开源 + npm 一键安装,中文原生体验
  • 未来可期:随着 ACP 协议普及,能接的后端会越来越多

仓库地址github.com/QwenAudio/qwen-audio-agent

Related

相关文章

延伸阅读

查看全部 →