国内外 Agent 工具语音输入对比
调研时间:2026-07-30。覆盖国内外 14 款主流 Agent 工具,从 6 个维度对比其语音输入实现。
维度说明
| 维度 | 说明 |
|---|
| ① 语音入口 | 用户从哪输入语音(App / Web / 客户端 / 浏览器扩展 / 系统级) |
| ② 技术路线 | 端到端多模态 / STT 转文字 / 双模都支持 |
| ③ 流式/打断 | 边说边出结果 + 中途打断模型继续说 |
| ④ TTS 输出 | 是否能”说回来”(语音播报) |
| ⑤ 底层模型 | ASR/TTS/对话具体用的什么模型 |
| ⑥ 典型场景 | 闲聊 / 编码 / 搜索 / 翻译 |
横向矩阵
| # | 产品 | ① 语音入口 | ② 技术路线 | ③ 流式/打断 | ④ TTS 输出 | ⑤ 底层模型 | ⑥ 典型场景 |
|---|
| 国外 | | | | | | | |
| 1 | ChatGPT | iOS/Android App、macOS 桌面、Web | 端到端多模态(gpt-4o audio)+ Web 端 Whisper STT 双模 | ✅ 高级语音模式可自然打断 | ✅(端到端多模态自带 TTS) | OpenAI Realtime API (gpt-4o-realtime / gpt-4o-audio) + Whisper | 闲聊/翻译/辅导 |
| 2 | Claude | 无官方语音入口 | ❌ 纯文本 | — | — | Claude 3.5/4(无 audio) | 编码/写作(语音需外接 Wispr Flow / Mac WhisperShortcut) |
| 3 | Gemini | Android App 系统级、Pixel 集成、App/网页 | 端到端多模态(Gemini 1.5/2.0 原生 audio) | ✅ Live API 支持实时打断 | ✅ | Gemini Multimodal Live API | 实时翻译/语音助手 |
| 4 | Perplexity | iOS/Android App | 推断:STT → Sonar 模型 → 文字回答 | 部分支持 | ✅ TTS 读出 | Sonar(基于 Llama 系)+ 第三方 STT/TTS | 语音搜索 |
| 5 | Cursor | VSCode 扩展(无内置语音) | ❌ 纯文本 | — | — | 多种 LLM(Claude/GPT 等) | 编码(语音走系统级 STT + 粘贴) |
| 6 | Codex CLI | 纯 CLI(无语音) | ❌ 纯文本 | — | — | OpenAI o-series / GPT-5 | 终端编码 |
| 7 | WorkBuddy | 推断:PC 端为主,可能走系统 STT 集成 | 推断:STT → 文本 | 推断否 | 推断否 | 推断:自研/混用多模型 | 编程协作 |
| 国内 | | | | | | | |
| 8 | 文心一言 | App / Web / 桌面 / 百度输入法集成 | 端到端(文心 4.0 Turbo 语音版,原生 audio) | ✅ 支持 | ✅ | 文心 ERNIE 多模态 + 自研 TTS | 通用助手/办公 |
| 9 | 通义千问 | App / Web / 钉钉集成 / 硬件(天猫精灵) | 双模:实时语音走 Qwen-Omni(原生 audio),App 走 STT + TTS | ✅ Qwen-Omni 可打断 | ✅ | Qwen-Omni + Qwen-TTS + CosyVoice + Fun-ASR | 全场景 |
| 10 | Kimi | App / Web | 推断:STT → Moonshot v1 文本模型 + TTS 播放 | 推断有限 | 推断有 | Moonshot Kimi k1.5 / k2 + 第三方 STT/TTS | 长文档/学习/闲聊 |
| 11 | 豆包 | App / Web / 抖音 / 智能硬件(豆包耳机) | 端到端(字节自研 Seed-ASR + 实时语音大模型) | ✅ 实时打断 | ✅ 自研 TTS,音色可克隆 | 字节豆包大模型 1.5/Pro + 火山引擎语音 | 闲聊/陪伴/办公 |
| 12 | 元宝 | 微信/QQ 集成 + App + Web | 推断:STT → 混元 → TTS | 推断有限 | ✅ | 腾讯混元大模型 + 腾讯云 ASR/TTS | 搜索/办公 |
| 13 | 智谱清言 | App / Web / API | 推断:STT → GLM-4 → TTS(GLM-4-Voice 是端到端但主要在 API/开源,C 端尚未完全铺开) | 推断否 | 推断有 | GLM-4 / GLM-4-Voice | 通用/学术/企业 |
| 14 | 秘塔 AI / 天工 | App / Web | 推断:STT 路线 + 搜索增强 | 待验证 | 待验证 | 各自基座模型(天工基于 Skywork) | 搜索/写作 |
关键发现
1. 两大技术流派
- 端到端多模态派:OpenAI Realtime、Gemini Multimodal Live、字节豆包、阿里 Qwen-Omni、文心语音版
- 优势:流式、低延迟、自然打断、保情绪信息
- 代价:贵、需专用推理(自研硬件/优化)
- STT→LLM→TTS 派:Perplexity、Kimi、元宝、智谱、Cursor、Codex、Claude(借第三方)
- 优势:模型可换、便宜、可纠错、文本 LLM 通用
- 代价:延迟高、副语言丢
2. 国内外路线明显分流
- 国内大厂(豆包、通义、文心)→ 自研语音大模型 + 端到端 + 强调”陪伴”和”硬件集成”(耳机、音箱)
- 海外大厂(OpenAI、Google)→ API 先行(Realtime API 给开发者),C 端 App 同步
- 国内中小厂 / 编码 Agent(Kimi、Cursor、Codex)→ STT 路线为主或干脆没语音
3. 编码 Agent 是”语音荒漠”
- Cursor / Codex / Continue / Cline / WorkBuddy 几乎都没有原生语音
- 原因:编程场景字面准确 > 情绪,开发者习惯键鼠 + 终端
- 用户要走语音得自己加:Wispr Flow(系统级 STT)/ Aqua Voice / Mac WhisperShortcut
4. TTS 几乎已成标配
- 13/14 都能”说回去”,只剩 Claude 和编码 Agent 默认纯文本
- 音色克隆(豆包、ElevenLabs 集成、Qwen-TTS)是新卖点
选型建议
| 你的需求 | 推荐路线 | 现成方案 |
|---|
| 聊天/陪伴/翻译 | 端到端 | OpenAI Realtime API、字节豆包、Qwen-Omni |
| 编码/技术问答 | STT 路线 | 系统级 Wispr Flow / Aqua Voice + 任意文本 Agent |
| 实时打断 + 多轮对话 | 端到端 Realtime | Gemini Live、OpenAI Realtime、豆包 |
| 极低成本 + 国产化 | STT + 国内文本 LLM | 阿里 Fun-ASR(免费) + 任意国产 LLM |
| 可商用开源 | 端到端开源 | GLM-4-Voice(智谱开源端到端语音 LLM) |
信息空缺
- Claude 桌面 App 是否 2026 已加语音?Anthropic 2025 H2 传过要做 desktop voice
- Kimi k2 是否带端到端 audio 能力?
- WorkBuddy 到底是哪个?需要明确产品来源
- 元宝 走微信小程序语音链路还是独立 ASR?
- 编码 Agent 的语音实现——是否有人用 Wispr Flow + Codex 串起来做的实际工作流
相关笔记
- [[AI/Agent/概览]] — Agent 系统总览(MCP / Tool Use / 工作流 / 记忆)
- [[AI/Agent/Agent发展|AI 系统演进]] — Agent 架构演进知识图谱
- [[开源项目分析/AI编码工程化/Trellis-AI编码工程框架|Trellis]] — 跨平台 AI Coding Agent Harness
- [[开源项目分析/AI编码工程化/Superpowers-AI编码工程师方法论与Skills框架|Superpowers]] — AI 编码工程师方法论