openJiuwen发布全双工多模态工作台
openJiuwen WorkSwarm正在把AI Agent的交互方式从单轮问答推进到“边聊边办事”。在复杂任务由后台执行时,用户仍可在前台继续提问、打断或补充要求,实时模型与Core Agent按不同节奏协同,减少等待带来的割裂感。
所谓全双工,接近电话式交流:AI在说话时仍能听到用户的新指令,用户不必等播报结束再开口。WorkSwarm围绕这一体验,将实时音视频交互与Core Agent执行接入同一任务。openJiuwen由华为2012实验室、华为云、终端、计算、算力先遣队等团队联合高校、企业和开发者共建,WorkSwarm则是其开源的办公与编码统一工作台。
这项能力已经提供可下载版本,而非仅停留在概念演示。用户可通过官网获取Windows、Mac、HarmonyOS等系统的一键安装包,安装后体验展示画面、语音插话、后台任务执行等功能。
在实时对话中,用户可以在AI播报时直接说出新要求,例如“先别介绍背景,直接说结论”。系统检测到有效人声后会停止当前播报,并继续处理新指令;已生成文本仍保存在任务记录中。语音活动检测和噪声门限用于降低环境声误触发。演示中,Agent朗读《岳阳楼记》时可被语音切换到《兰亭集序》。不过,插话只影响当前对话,已经交给Core Agent运行的工具任务需要在任务控制中单独停止。
WorkSwarm将即时交流和耗时任务分成两条路径:实时模型负责看画面、听指令并快速回应,Core Agent负责拆解任务、调用工具、搜索资料、分析内容和生成文件。例如用户先问画面中的品牌,再要求整理资料成文档,搜索和生成可在后台推进,前台仍可继续围绕当前画面追问或打断播报。
任务进入Core Agent后,界面会显示运行状态、工具调用记录、执行结果和生成文件,而不只是等待动画。演示中,系统被要求读取算法Word文档,任务在右上角队列中运行,同时用户仍能与Agent正常对话。任务完成后,系统不会强行打断正在进行的聊天,而是先在文本框给出总结,待本轮对话结束后再像同事汇报工作一样提炼关键信息。
当多个后台任务同时出现时,WorkSwarm提供全双工任务队列。用户可以查看哪些任务正在执行、哪些正在等待,也能调整顺序、设为下一项,或停止等待中及运行中的任务。音视频连接与工具任务分开管理,即使关闭全双工音视频,已提交给Core Agent的工作仍可继续,完成后的文本、工具结果和文件会回到原对话中。
使用方面,模型和语音通道可在设置中配置,目前支持JoyAI协议和Qwen Omni协议;Qwen Omni realtime websocket可填写官方base_url或本地部署地址。JoyAI由ASR、LLM、TTS三类模型拼接,可全部使用官方API,也可接入其他平台的语音识别和语音合成模型。此外,WorkSwarm还支持通过华为云ModelArts平台,基于vLLM-Omni推理框架在昇腾系列NPU部署全双工多模态模型,并对接其多模态全双工能力。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文