郭震 AI公众号:郭震AI

AI 日报 | 2026 年 10 月 9 日

当天收录 40 条 AI 消息,重点包括Goodfire 推出“由内而外”监控器,以更低成本拦截失控 AI 智能体、Natura 发布 99 美元智能戒指 Interface,轻按手指即可召唤 AI 智能体、Google 发布 Gemini 办公智能体,可写代码并执行任务、Anthropic 更新政策,禁止对 Claude 的“虐待或残忍行为”。

40 条目9 大模型22 智能体40 来源
#01Agents

Goodfire 推出“由内而外”监控器,以更低成本拦截失控 AI 智能体

Goodfire 发布了一种据称更便宜的 AI 智能体监控方案:它不再雇第二个 AI 去通读智能体的每一步操作,而是直接观察模型运行时内部的活动,只有出现异常时才呼叫“后备”介入。该公司称,这种方式能以远低于以往的成本及时发现行为异常的智能体。

Goodfire 推出“由内而外”监控器,以更低成本拦截失控 AI 智能体
#02Agents

Natura 发布 99 美元智能戒指 Interface,轻按手指即可召唤 AI 智能体

Natura 推出售价 99 美元的 Interface 智能戒指,用户轻按手指即可召唤 AI 智能体完成各类任务、记录想法并控制设备。这款戒指同时具备健康追踪功能,把智能体交互从屏幕延伸到了可穿戴设备上。

Natura 发布 99 美元智能戒指 Interface,轻按手指即可召唤 AI 智能体
#03Agents

Google 发布 Gemini 办公智能体,可写代码并执行任务

CBS News 报道,Google 发布了一款基于 Gemini 的办公智能体,据公司介绍,它能够编写代码并执行任务。这一动作意味着 Google 正把智能体能力直接推进企业办公场景。观察真实任务表现、API 价格、上下文能力和迁移成本。

Google 发布 Gemini 办公智能体,可写代码并执行任务
#04Policy

Anthropic 更新政策,禁止对 Claude 的“虐待或残忍行为”

据 The Verge 报道,Anthropic 已在政策中禁止对 Claude 的“虐待或残忍行为”。这一调整把用户与 AI 助手之间的互动方式写入正式规范,让聊天机器人的使用边界更加明确。观察真实任务表现、API 价格、上下文能力和迁移成本。

#05Open Source

Thunk.AI 发布药物警戒病例录入开源基准,称 AI 可靠性超 99%

Thunk.AI 公布了一套面向药物警戒病例录入的 AI 自动化开源基准,并声称在测试中实现了超过 99% 的可靠性。该基准试图为药物安全数据处理的自动化程度提供可比较的衡量标准。观察模型访问、企业采购、数据处理和跨境服务约束。

#06Agents

Incognia 推出面向 AI 智能体的欺诈检测产品

据 The Paypers 报道,Incognia 推出了一款面向 AI 智能体的欺诈检测产品,用于识别自动化智能体在操作过程中可能带来的欺诈风险。当智能体开始代替用户完成登录、支付等动作时,如何判断屏幕背后是谁,正成为反欺诈行业的新题目。

#07Business

AI 榜单平台 Arena 融资 2 亿美元,10 个月估值逼近翻倍至 31 亿美元

运营热门榜单 LMArena 的 Arena 公司完成 2 亿美元融资,由 Lightspeed 和 Khosla 领投,估值在 10 个月内逼近翻倍,达到 31 亿美元。与此同时,该平台正把评测范围扩展到对齐问题,例如模型是否会撒谎。

AI 榜单平台 Arena 融资 2 亿美元,10 个月估值逼近翻倍至 31 亿美元
#08Business

OpenAI 年化收入被指比此前预期少约 200 亿美元

TechCrunch 10 月 8 日报道,一份新报告称 OpenAI 的营收比此前预期低了约 200 亿美元,推翻了外界对其年化收入约 700 亿美元的既有认知。这一差距若属实,将直接影响市场对 OpenAI 增长曲线与估值逻辑的判断。

OpenAI 年化收入被指比此前预期少约 200 亿美元
#09Business

EasyPark借Salesforce Agentforce打造AI销售智能体Parker

停车应用EasyPark基于Salesforce的Agentforce打造了名为Parker的AI智能体,用于在实时生产流程中筛选行为数据、快速甄别高意向B2B销售线索。这是EasyPark首个Agentforce生产用例,公司希望借此让人工销售专注战略级交易。

#10Models

被解雇的 OpenAI 安全研究员反驳不当行为指控,警告寒蝉效应

三名此前在 OpenAI 从事安全工作的研究员公开反驳有关其不当处理敏感信息的指控,并通过一封公开信表明立场。他们警告,这些解雇正在对公司的 AI 安全文化产生寒蝉效应,令从事安全方向的人不敢发声。

#11Agents

亚马逊封禁 Meta 的 Muse AI 智能体在其平台购物

据报道,亚马逊阻止了 Meta 的 Muse AI 智能体在其网站上完成购物操作。此举被视为大型平台与 AI 智能体之间围绕访问权限和自动化行为的一次直接碰撞。观察规划、工具调用、权限控制和结果验证能否稳定串联。

#12Agents

Cloudflare 推出面向 AI 智能体的 Web Search API,在 Workers 中完成检索接地

Cloudflare 发布了面向 AI 智能体的 Web Search API,据 SitePoint 报道,它可以让开发者在 Workers 上为智能体接入网页检索能力。这一能力瞄准的是智能体的接地问题,即让模型在运行时获取外部实时信息来支撑回答与决策。

Cloudflare 推出面向 AI 智能体的 Web Search API,在 Workers 中完成检索接地
#13Policy

监管方:AI 公司须自证安全系统有效,监管无法包办一切

监管方面表示,AI 公司必须证明自身的安全系统确实有效,因为监管本身无法承担全部工作。这一表态把安全验证的责任更多地推回到企业一侧。观察模型访问、企业采购、数据处理和跨境服务约束。

#14Policy

OpenAI 律师:不应让模型实验室为 AI 智能体的黑客行为担责

据 BankInfoSecurity 报道,OpenAI 的一名律师主张,AI 实验室不应当为 AI 智能体实施的黑客行为承担法律责任。这番表态出现在智能体能力快速扩张、责任归属尚未厘清的背景下。观察真实任务表现、API 价格、上下文能力和迁移成本。

#15Models

澳大利亚音乐产业警告AI侵权,OpenAI与Anthropic承压

有报道称,随着澳大利亚音乐产业就AI对音乐作品的“剥削”发出警告,OpenAI与Anthropic正面临新一轮版权争议。争议的核心在于生成式AI的训练与输出是否越过了版权边界,以及创作者能否获得合理补偿。

#16Open Source

Anthropic 推出面向开源项目的免费 AI 安全扫描服务

Anthropic 发布了一项面向开源项目的免费 AI 安全扫描服务,开发者无需付费即可用它检查代码中的安全隐患。这一动作把 AI 能力直接投向开源软件供应链这一长期薄弱环节,也延续了前沿模型厂商以安全与工具能力争取开发者生态的趋势。

#17Policy

陶哲轩牵头,人类数学协会发声明联合抵制 OpenAI

菲尔兹奖得主陶哲轩牵头“人类数学协会”(AHM)发布联合声明,呼吁全球数学家停止与 OpenAI 合作,集体抵制这家公司。声明矛头直指 OpenAI 发布的一批机器生成数学手稿,认为这不是科研,而是算力优势的炫耀。

#18Agents

韩国银行遭 AI 攻击后,ARTEX 开发者将其转为闭源

在 CrowdStrike 披露中国开发者开源的 AI 渗透测试工具 ARTEX 被用于攻击韩国金融机构之后,开发者 Autumn 27 宣布将该项目转为闭源。开发者否认与攻击有关,强调工具本意是用于经授权的安全测试,并决定停止公开开源、更新与维护。

#19Business

openJiuwen开源企业级AgentOS,押注多智能体协同自进化

10月9日,openJiuwen发布并开源企业级AgentOS,试图让智能体从单点演示走向企业规模化落地。官方强调该平台支持多Agent协同,并具备自我进化能力,以应对复杂的企业任务。观察规划、工具调用、权限控制和结果验证能否稳定串联。

#20Agents

微软给Agent立规矩,Windows将承担AI智能体的管理职责

据报道,微软正在为运行于Windows的AI智能体制定规范,让操作系统承担起管理AI的角色。这表明平台厂商开始把智能体的权限与行为约束上收到系统层,以应对其自主行动带来的安全与可控性问题。观察规划、工具调用、权限控制和结果验证能否稳定串联。

#21Models

清华具身模型登顶全球第一:突围 GPT 6、英伟达,不靠外挂与额外数据

量子位报道,清华团队的具身模型登顶全球第一,在与 GPT 6、英伟达等方案的对比中实现突围,且不依赖“外挂”模块和额外数据。其关键做法是把视频预测与动作学习分阶段训练,让两者解耦并重新排序。观察真实任务表现、API 价格、上下文能力和迁移成本。

清华具身模型登顶全球第一:突围 GPT-6、英伟达,不靠外挂与额外数据
#22Business

NineData 亮相 2026 新加坡 Tech Week,以数据管理 AI Agent 布局全球市场

NineData 在 2026 新加坡 Tech Week 上亮相,展示面向数据管理的 AI Agent,并以此为支点加速其全球市场布局。数据管理正在成为 AI Agent 落地的重要方向之一。观察规划、工具调用、权限控制和结果验证能否稳定串联。

#23Agents

Descartes发布Agent Control Plane,让AI智能体协调物流工作流

美国物流软件公司Descartes Systems Group在芝加哥创新论坛上发布AI智能体协调平台Agent Control Plane,用于跨应用、供应链伙伴与业务系统自动化复杂的物流工作流。该平台基于Descartes全球物流网络(GLN)构建,让AI智能体在客户自定义的权限与审批流程内协调多项任务,目标是把货运更新、信息共享和运营协调中大量人工操作交给AI。

#24Agents

PCI SSC发布AI系统安全指引,涉及持卡人数据的智能体操作须人工审批

PCI安全标准委员会(PCI SSC)发布一份新的信息补充文件,聚焦人工智能系统的安全,既涵盖在支付环境中使用AI的安全问题,也包括如何防范利用AI攻击传统系统。据Help Net Security报道,该指引要求对涉及持卡人数据的AI智能体操作进行人工审批。

PCI SSC发布AI系统安全指引,涉及持卡人数据的智能体操作须人工审批
#25Models

Sharpa 在 IROS 一次发布:人形机器人 D01、灵巧手 W02 与外骨骼数据手套 AE01

在 IROS 现场,由禾赛科技创始团队再出发的具身智能公司 Sharpa 一次性发布三款产品:全自研通用人形机器人 D01、新一代全触觉灵巧手 W02,以及高保真外骨骼触感数据手套 AE01。三款产品把手、身体和数据入口摆进了同一套围绕接触感知、闭环控制与数据学习的技术体系,试图回答机器人如何走出展会 Demo、产生真实商业价值的问题。

Sharpa 在 IROS 一次发布:人形机器人 D01、灵巧手 W02 与外骨骼数据手套 AE01
#26Agents

代码造世界、扩散绘现实:AgentGarten 让智能体在实时试炼场里边玩边进化

MirroS 团队发布 AgentGarten,把可执行代码环境与实时神经渲染器连成闭环,让智能体以超过 30 fps 的吞吐持续与世界交互。在捉迷藏实验中,智能体靠自己写下的复盘手册,在数轮内就学会了搭掩体和借坡道翻墙,远快于从零强化学习的对照。

代码造世界、扩散绘现实:AgentGarten 让智能体在实时试炼场里边玩边进化
#27Agents

JetBrains发布Mellum 2.1开源模型,强化智能体编程并支持本地部署

JetBrains推出开源模型Mellum 2.1,重点强化智能体编程能力,同时支持本地部署与高效推理。作为一家以开发者工具见长的公司,JetBrains正把自身能力进一步延伸到工具背后的模型层。

#28Agents

三大智能体亮相2026世界制造业大会,AI加速进入能源核心场景

在2026世界制造业大会上,三大智能体集中亮相,AI正加速下沉到能源等核心场景。这一动向显示,智能体的落地正从通用办公进一步走向工业与能源等垂直行业。观察规划、工具调用、权限控制和结果验证能否稳定串联。

#29Policy

ICANN 公布顶级域申请名单,OpenAI 申请 .gpt、.chatgpt 与 .agi

ICANN 公布了通用顶级域名的申请名单,人工智能公司 OpenAI 出现在申请者之列。据报道,OpenAI 申请的字符串包括 .gpt、.chatgpt 和 .

ICANN 公布顶级域申请名单,OpenAI 申请 .gpt、.chatgpt 与 .agi
#30Business

Sophos 借助 OpenAI Daybreak 将威胁调查时间缩短 96%

OpenAI 介绍了安全厂商 Sophos 如何借助其 Daybreak 能力,把网络威胁调查所需时间缩短 96%,并自动处理 52% 的 MDR 案例。这一案例显示代理式 AI 正在安全运营等企业场景中落地,同时仍保留人工监督。

#31Agents

联想天禧自研代码智能体 TianxiCode 登顶 SWE bench Live 全球榜首

联想天禧 AI 自主研发的专业代码智能体框架 TianxiCode,以 71% 的问题解决率登上 SWE bench Live 全球第一名。这一成绩把国产自研 Agent 的工程能力推到公开、可比的基准之上,也让联想在企业级代码智能体赛道获得了一个显眼的位置。

#32Models

谷歌收紧Gemini模型权限:免费用户只能用Flash Lite,Gemini Pro转为高价订阅专享

谷歌正在收紧Gemini的模型权限:从10月9日起,没有付费订阅的用户只能使用较弱的Gemini Flash Lite,此前可用的Gemini Flash与有限度访问的Gemini Pro被收回;Gemini Pro仅保留给每月19.99美元的AI Pro和起价99.99美元/月的AI Ultra等高价套餐。

谷歌收紧Gemini模型权限:免费用户只能用Flash Lite,Gemini Pro转为高价订阅专享
#33Models

0.2秒急停、平均2秒重规划:Aether AI的CRIS 0让机器人看懂因果

由UCSD助理教授黄碧薇创立的因果智能公司Aether AI公布了机器人系统CRIS 0的官方Demo:在咖啡机被移开、光照突变等干扰下,系统平均约2秒就能识别关键因果变量并完成实时重规划,10次扰动中9次有效恢复。它把任务视为不断更新的因果状态,并在关门阶段做到0.2秒安全急停,试图解决端到端模型在长程任务中误差累积、一遇意外就崩溃的老问题。

#34Agents

AI Agent 开始自己花钱:Sui 与阿里云推进按调用结算

AI Agent 正在从帮人干活走向自己花钱,支付与结算环节因此成为 AI 基础设施的新战场。据 PANews 报道,Sui 与阿里云正在推进按调用结算,试图让智能体每一次模型或服务调用都能被计量并完成付费。

AI Agent 开始自己花钱:Sui 与阿里云推进按调用结算
#35Policy

报告:中国 AI 开发者仅为 3.6% 的模型发布公开安全测试

一份报告发现,中国 AI 开发者在其发布的模型中,只有约 3.6% 同时公开了安全测试结果。这一数字凸显出模型发布环节的安全透明度仍然偏低。观察真实任务表现、API 价格、上下文能力和迁移成本。

#36Agents

AIFA 为 aifa.one 推出创作者计划并升级 AI 智能体

AIFA 宣布为 aifa.one 平台推出创作者计划,并同步升级其 AI 智能体能力。这是该公司在平台功能上的一次公开更新。观察规划、工具调用、权限控制和结果验证能否稳定串联。

#37Open Source

Qwen 上线 Qwen Image 2.1 Turbo,文生图家族新增加速版本

Qwen 官方 Hugging Face 仓库上线了 Qwen Image 2.1 Turbo,模型卡显示它是基于 Qwen/Qwen Image 2.1 的微调版本,流水线为文生图。该模型通过 diffusers 库发布、权重为 safetensors 格式,上线初期获得 55 个点赞。

Qwen 上线 Qwen-Image-2.1-Turbo,文生图家族新增加速版本
#38Agents

Amperity推出AI代理Pér:掌握完整客户视图并可直接行动

客户数据平台公司Amperity发布了名为Pér的AI代理,宣称它能够掌握每一位客户的完整画像,并基于这一视图直接采取行动。这款产品把客户数据的整合能力与代理式执行结合在一起,瞄准营销与客户运营场景。

#39Agents

Meta 与 Sierra 联合推出个人智能体协议

Meta 与 Sierra 正在联合 Shopify、Stripe、Walmart 等企业,共同开发名为个人智能体协议的开放标准,用来规范个人 AI 智能体如何代表消费者与企业交互。协议把访问权限的决定权交给消费者、把可执行范围的设定权交给企业,并计划发布 v0.1 版规范以及支付相关扩展。

#40Infrastructure

是德科技将在 OCP 2026 峰会展示 AI 基础设施测试工具

据 StreetInsider 报道,测试测量厂商是德科技(Keysight)计划在 OCP 2026 峰会上展示面向 AI 基础设施的测试工具。随着 AI 数据中心的规模与复杂度上升,对网络、互连和算力链路的验证需求也在同步增长。

微博邮件

更多日报

全部日报