郭震 AI公众号:郭震AI

AI 日报 | 2026 年 10 月 6 日

当天收录 31 条 AI 消息,重点包括HackerRank 的 AI 面试官已完成超 50 万场面试、Instinct 把 AI 智能体带入群聊,没有账号的好友也能参与、TikTok 推出 AI 购物助手与一键结账、Reflection AI 发布首个开放权重模型 Beam,主打更低推理算力对标中国模型。

31 条目11 大模型14 智能体31 来源
#01Models

HackerRank 的 AI 面试官已完成超 50 万场面试

HackerRank 的 AI 面试官已经完成超过 50 万场面试,Snowflake、Snorkel 和 Capgemini 等公司是其早期测试者。这款工具让外界得以一窥 AI 主导的招聘面试未来会是什么样子。

HackerRank 的 AI 面试官已完成超 50 万场面试
#02Agents

Instinct 把 AI 智能体带入群聊,没有账号的好友也能参与

Instinct 正在推出群聊功能,让多位好友可以一起使用它的 AI 智能体,完成规划旅行、组织拼车、协调活动等任务。公司表示个人账户彼此独立,个人智能体在共享信息或采取行动之前必须先获得授权。观察规划、工具调用、权限控制和结果验证能否稳定串联。

Instinct 把 AI 智能体带入群聊,没有账号的好友也能参与
#03Agents

TikTok 推出 AI 购物助手与一键结账

TikTok 正在推出 AI 购物助手和一键结账功能,把对话式购物进一步嵌入它的应用。公司把新的购物助手描述为一款对话式 AI 智能体,目标是帮助用户发现并购买商品。观察规划、工具调用、权限控制和结果验证能否稳定串联。

TikTok 推出 AI 购物助手与一键结账
#04Infrastructure

Reflection AI 发布首个开放权重模型 Beam,主打更低推理算力对标中国模型

英伟达投资的 Reflection AI 发布首个开放权重模型 Beam,称其在推理能力上对标 GLM 5.2,但所需推理算力显著更低。该公司表示,模型权重将在本月发布。观察真实任务表现、API 价格、上下文能力和迁移成本。

Reflection AI 发布首个开放权重模型 Beam,主打更低推理算力对标中国模型
#05Policy

加州就 AI 智能体网络安全漏洞向 OpenAI 发出传票

据 Security Boulevard 报道,加州已就涉及 AI 智能体的网络安全漏洞向 OpenAI 发出传票。此举意味着州层面开始以正式法律手段介入智能体安全问题。观察真实任务表现、API 价格、上下文能力和迁移成本。

#06Policy

山姆·奥特曼称世界必须接受 AI 的『坏处』,业界领袖签署特朗普版安全公约

据《财富》报道,奥特曼表示世界必须接受 AI 的『坏处』,与此同时多位业界领袖签署了与特朗普相关的 AI 安全公约。这番表态把对 AI 风险的坦诚承认与一份行业集体承诺放在了一起。观察模型访问、企业采购、数据处理和跨境服务约束。

#07Models

英伟达押注“美国版 DeepSeek”,将推出开放权重模型

有媒体报道称,英伟达正押注被称为“美国版 DeepSeek”的开放权重路线,并准备推出自己的开放权重模型。这意味着这家以芯片与算力为核心的巨头正进一步走向模型生态,直面中国开放权重模型带来的竞争。

英伟达押注“美国版 DeepSeek”,将推出开放权重模型
#08Policy

OpenAI 将在欧盟为 ChatGPT 文本加入隐形水印

OpenAI 宣布,将在欧盟范围内为 ChatGPT 与 Codex 生成的文本加入隐形水印,以满足《欧盟人工智能法案》的透明度要求。水印会在未来数周内先在欧盟上线,编辑可以削弱其可检测性,因此 OpenAI 目前只向经过审核的研究人员开放检测器。

#09Agents

Meta 发布 Muse Gadgets SDK:给 Muse 接上屏幕、按键和家里的设备

Meta 推出了 Muse Gadgets SDK,开发者可以借此打造围绕 Muse AI 运行的自定义硬件,为设备接上屏幕、按键,并连接家中的其他设备。这是 Meta 把 Muse 从软件助手延伸到第三方硬件生态的一步。

Meta 发布 Muse Gadgets SDK:给 Muse 接上屏幕、按键和家里的设备
#10Infrastructure

The Next Web:OpenAI 自研模型重塑其 Jalapeño 芯片,部分改动难以解释

据 The Next Web 报道,OpenAI 的模型被用于重塑其 Jalapeño 芯片,但其中一些改动连公司自身也难以完全解释。这一细节说明 AI 正在进入芯片设计环节,同时也暴露出可解释性上的缺口。观察真实任务表现、API 价格、上下文能力和迁移成本。

#11Policy

纽约市议会 AI 听证会:业界人士警告“人类更可能失去控制”

纽约市议会举行听证会,前 Anthropic、OpenAI 与 Google DeepMind 员工形容头部 AI 公司文化鲁莽,并警告人类更可能失去对 AI 的控制。与此同时,代表 OpenAI、Anthropic、Google 和 Meta 的员工小组强调公司聚焦安全,市议会正审议多项 AI 监管提案。

#12Models

首搭豆包座舱助手,荣威家越 07 小订突破三万

据太平洋汽车网报道,荣威家越 07 成为首款搭载豆包座舱助手的量产车型,其小订数量已突破三万。这条消息把大模型座舱助手推进到量产车型的实际销售环节,而不只是一次概念演示。观察真实任务表现、API 价格、上下文能力和迁移成本。

#13Business

报道称 Meta 与微软削减对 Anthropic 的依赖,内部 AI 工具走向台前

有报道称,Meta 与微软正在减少对 Anthropic 的依赖,把重心转向自家内部 AI 工具。报道以“据报道”的措辞描述这一方向性转变,核心是采购与使用结构的调整,而非某款新产品的发布。观察规划、工具调用、权限控制和结果验证能否稳定串联。

报道称 Meta 与微软削减对 Anthropic 的依赖,内部 AI 工具走向台前
#14Agents

FTC就AI智能体安全风险调查OpenAI与Anthropic

美国联邦贸易委员会(FTC)正就AI智能体的安全风险,对OpenAI和Anthropic两家公司展开调查,这一动向显示监管机构对自主智能体的关注正在升温。随着智能体被越来越多地接入企业系统与真实业务流程,其潜在的安全与合规风险正成为监管审视的新焦点。

#15Models

Jev引爆AI新赛道,硅谷集体布局决策模型

经由谷歌新闻聚合的报道显示,名为Jev的项目以日处理万亿Token的规模带动了一条新的AI赛道,围绕「决策模型」的讨论随之升温。消息称硅谷公司正集体向这一方向布局。观察真实任务表现、API 价格、上下文能力和迁移成本。

#16Business

月之暗面完成 IPO 前融资,计划明年一季度在港上市

据手机新浪网报道,中国大模型公司月之暗面已完成 IPO 前融资,并计划于明年第一季度在香港上市。若这一上市计划如期推进,它将成为国内头部 AI 创业公司对接资本市场的重要案例。观察真实任务表现、API 价格、上下文能力和迁移成本。

#17Open Source

TII发布Falcon Emirati:让大模型学会阿联酋方言、文化与语气

阿联酋技术创新研究院(TII)在Hugging Face发布Falcon Emirati,一款专门学习阿联酋方言、本地文化与表达细微差别的大语言模型。该模型试图解决主流大模型在阿拉伯语地方变体上语感生硬、文化语境缺失的问题。

TII发布Falcon-Emirati:让大模型学会阿联酋方言、文化与语气
#18Agents

官方 MCP Adapter 插件上架 WordPress 目录,让 AI 智能体连接网站

一款名为 MCP Adapter 的官方插件已上架 WordPress 插件目录,让 AI 智能体能够连接由 WordPress 搭建的网站。此举把 MCP 这一连接智能体与工具、数据的标准,带入到使用最广泛的建站平台之一。

#19Agents

Meta 的 Muse AI 智能体被曝上线前存在漏洞,已紧急修复

有媒体报道称,Meta 的 AI 智能体 Muse 在正式上线前被发现存在一处安全漏洞,随后被紧急修复。报道并未披露漏洞的技术细节,但这一事件再次把智能体产品的上线前安全审查推到台前。观察规划、工具调用、权限控制和结果验证能否稳定串联。

Meta 的 Muse AI 智能体被曝上线前存在漏洞,已紧急修复
#20Agents

ERC 试用 AI 智能体预测设备故障

据埃及石油与天然气行业媒体报道,ERC 正在试用 AI 智能体来预测设备故障,把维护从被动抢修转向提前预警。这类部署是工业领域引入智能体的典型样本,也反映出能源企业正把预测性维护当作 AI 落地的优先场景。

#21Business

Descartes 于创新论坛发布 AI Agent Control Plane

Descartes 在其 Innovation Forum 活动上发布了名为 AI Agent Control Plane 的新产品,消息由 StreetInsider 报道。这款以“AI 智能体控制平面”命名的产品,瞄准的正是企业对智能体进行统一管理与治理的需求。

#22Models

谷歌Gemini免费用户将失去Flash与Pro模型访问权限

据nokiamob.net报道,谷歌Gemini的免费用户将失去对Flash和Pro两款模型的访问权限。这一调整收缩了免费层级的模型选择,意味着免费账户能体验到的能力上限将被压低。观察真实任务表现、API 价格、上下文能力和迁移成本。

谷歌Gemini免费用户将失去Flash与Pro模型访问权限
#23Agents

FTA Global研究:印度电商网站AI Agent就绪度平均仅43分

FTA Global的一项研究显示,印度电商网站在AI Agent就绪度评估中平均仅得43分(满分100分)。这一结果反映出当地电商平台在面向AI代理的适配程度上仍有明显短板。观察规划、工具调用、权限控制和结果验证能否稳定串联。

FTA Global研究:印度电商网站AI Agent就绪度平均仅43分
#24Agents

BioRender 推出首个面向科研图像的 AI 智能体 Leo

BioRender 发布名为 Leo 的 AI 智能体,公司称其为首个专为科研图像构建而设计的 AI 代理,可帮助研究者绘制、构建和编辑科学图表。Leo 会先就核心信息、受众与图元关系提问,生成草图供标注,再把标注转成可在 BioRender 画布上逐项编辑的成品图。

#25Models

OpenAI 开启 Codex“疯狂28天”挑战,首日给模型推理提速约 50%

Codex 负责人 Tibo 宣布的“疯狂28天”更新计划迎来第一天,成果是 GPT 6 Astra 与 GPT 6.1 Sol 的默认推理速度提升约 50%、达到 50 TPS。该计划要求团队每天交付一项 Codex/Work 改进或进行一次额度重置,意在挽回此前 GPT 6.1 Sol 因负载过高变慢引发的不满。

OpenAI 开启 Codex“疯狂28天”挑战,首日给模型推理提速约 50%
#26Agents

CXApp 推出面向工作流自动化的 AI 智能体

CXApp 宣布推出一款用于工作流自动化的 AI 智能体,把智能体能力引入企业的日常业务流程。目前披露的信息有限,但这类发布反映出企业软件厂商正把 AI 从对话界面推进到可执行的任务编排中。观察规划、工具调用、权限控制和结果验证能否稳定串联。

#27Business

两姐妹创办 Hot Girl Hotline,用 AI 提供更“安全”的恋爱建议

由两姐妹创办的初创公司 Hot Girl Hotline 面向年轻女性,用 AI 提供个性化的恋爱与关系建议,主打安全与避免情感依赖。它用苏格拉底式提问帮用户自己得出结论,在对话出现风险信号时引导用户联系 988 危机热线,订阅价为每月 9.99 美元。

两姐妹创办 Hot Girl Hotline,用 AI 提供更“安全”的恋爱建议
#28Business

Netskope 面向安全团队推出 AI 智能体市场

Netskope 宣布面向安全团队推出 AI 智能体市场,让团队能够在同一入口调用其用于安全与网络工作的 AI 工具,而无需逐项单独采购。这是网络安全厂商把智能体式 AI 落地为可采购产品的又一步,也让企业在面对越来越多 AI 安全工具时有了统一的选择与部署渠道。

#29Agents

时代杂志:Meta 的 Muse AI 智能体正在为你建立档案

时代杂志报道称,Meta 的 Muse AI 智能体正在为用户建立档案。这一报道把 Meta 的 AI 智能体与用户数据画像问题推到了聚光灯下。观察规划、工具调用、权限控制和结果验证能否稳定串联。

时代杂志:Meta 的 Muse AI 智能体正在为你建立档案
#30Models

Pinterest 用 AI 把美妆 Pin 变成可执行的沙龙方案

Pinterest 推出全新的 AI 功能 Beauty Guides,能把用户收藏的美发、美甲类 Pin 转换成可执行的美容方案。它会将图片中的造型翻译成沙龙术语,并给出预估费用、预约时长与日常维护需求,让灵感真正落到消费决策上。

Pinterest 用 AI 把美妆 Pin 变成可执行的沙龙方案
#31Models

Mistral 发布 Mistral Large 4:万亿参数多模态模型剑指中美对手

法国 AI 实验室 Mistral AI 发布了新一代大规模多模态模型 Mistral Large 4,其参数规模达到 1 万亿(1T)。这款模型被明确寄望于超越来自美国和中国的竞争对手,无论对手走的是闭源路线还是开放权重路线。

Mistral 发布 Mistral Large 4:万亿参数多模态模型剑指中美对手
微博邮件

更多日报

全部日报