实时 AI 消息
OpenAI将ChatGPT Voice语音模式带到桌面端,可语音操控Codex和Agent
OpenAI于7月24日宣布为其ChatGPT桌面应用加入语音模式支持,用户现在可以通过语音与AI助手对话并控制其执行计算机操作任务。该功能基于OpenAI本月早些时候发布的ChatGPT-Live语音模型系列,可配合ChatGPT Work和Codex完成多步骤指令。
OpenAI于周四宣布更新其ChatGPT桌面应用,正式加入ChatGPT Voice语音模式支持。用户现在可以直接与桌面端AI助手对话,通过语音指令操控AI代理完成计算机上的各项任务。
这项新功能基于OpenAI本月早些时候推出的全新语音模型系列ChatGPT-Live。该系列模型专为更自然的实时对话设计,为桌面端的语音交互体验提供了底层技术支持。
OpenAI表示,ChatGPT Voice可与ChatGPT Work和Codex协同工作,还能利用计算机使用技能来查阅网站和应用。在macOS平台上,通过Appshots功能,用户可以让ChatGPT语音助手访问屏幕内容,包括替代文本信息。
与手机版本相比,此次桌面端更新的能力更为强大。手机版ChatGPT Voice虽然已经实现了更流畅的对话和更好的打断处理,但并未被设计为在手机上执行操作。桌面端则允许用户通过语音口述涉及多步骤的复杂指令,并在ChatGPT需要用户输入时进行响应。
在一则演示视频中,OpenAI展示了一名开发者通过语音向ChatGPT发出指令,要求其创建新线程、提交拉取请求并查找Bug的根因——所有操作仅需一条语音命令即可完成。同时,公司表示用户可以通过iOS应用远程访问的方式,在Codex中使用ChatGPT Voice。
这一更新标志着AI语音交互从单纯的问答场景向真正的计算机操控场景迈出了重要一步。此前,Anthropic也更新了Claude的语音模式,使其能够调用Opus、Sonnet和Haiku模型,在Gmail、Calendar、Slack、Notion和Canva等应用中完成任务。
AI语音助手正在从“能听会说”向“能理解、能执行”演进。桌面端语音操控Agent的能力意味着用户未来可能通过自然语言直接管理开发工作流、数据分析任务和日常办公软件操作,大幅降低人与AI之间的交互门槛。值得关注的是,这种语音+Agent的组合是否会在企业办公场景中率先规模化落地。
来源
为什么重要
OpenAI将语音模式带入桌面端并从简单的对话扩展到Agent操控,标志着AI语音交互从问答场景向真正的计算机操控场景进化。这项能力有望大幅降低AI Agent的使用门槛,推动企业级AI助手从文本输入向语音交互的范式转变。
附近消息
全部07/24 21:46
小米新机入网备案文心一言、DeepSeek、通义千问等十余款大模型,或搭载澎湃OS 4
博主@数码闲聊站爆料,小米一款型号为2608BPX34C的新机已通过入网审核,备案了包括小米大模型、智谱AI、文心一言、DeepSeek、通义千问、混元等十余款大模型。消息人士推测这批备案可能为即将到来的澎湃OS 4系统做准备。
07/24 21:05
Brown & Brown携手Anthropic、麦肯锡和埃森哲构建AI模型
美国保险经纪巨头Brown & Brown宣布与Anthropic、麦肯锡和埃森哲合作,共同构建其AI模型。此举标志着大型传统企业加速将前沿AI能力融入核心业务运营。
07/24 20:55
谷歌Gemini 3.5 Pro因算力约束延期,AI行业算力瓶颈持续加剧
据MarketScale报道,谷歌新一代旗舰模型Gemini 3.5 Pro因算力约束而落后于原定发布计划。这一延期反映了AI行业普遍面临的算力瓶颈问题,大模型军备竞赛正遭遇基础设施层面的硬约束。
07/24 22:19
兔展智能联合北大、鹏城实验室研发的UniWorld-View登顶李飞飞团队世界模型榜单
兔展智能联合北京大学、鹏城实验室研发的UniWorld-View模型登顶李飞飞团队世界模型榜单。该模型支持单张图片或单目视频生成任意视角的新视角视频,已适配国产昇腾算力,代码和权重已全部开源。