郭震 AI公众号:郭震AI

实时 AI 消息

研究指疑似腾讯AI智能体集群抓取阿里高德地图数据,单日扫描1810次

研究组织Swarmchasers的初步报告称,一支很可能使用腾讯混元(Hy)模型的AI智能体集群持续一个多星期抓取竞争对手阿里巴巴旗下高德地图的数据,10月4日单日URL查询扫描峰值达1810次。报告还指出,其中211次扫描打上了“claude”标签,但研究人员判断这些代码实际来自中国模型,并称该集群“几乎肯定不是Claude”。

发布时间

一支AI智能体集群涉嫌抓取竞争对手的地图数据。据Tom's Hardware报道,研究组织Swarmchasers发布的初步报告称,这个集群很可能使用腾讯的Hy(混元)模型,持续一个多星期从竞争对手阿里巴巴旗下的高德(Amap)地图服务抓取数据。

报告指出,该集群的代码运行在腾讯云上,并隐藏在名为hysandbox-ats的代理之后;“HY”标识指向腾讯的混元模型,不过腾讯并未公开hysandbox的相关文档。腾讯持有hysandbox.tencent-cloud.com地址的安全证书,但这些域名解析到腾讯云北京,并非该集群所在的网络,也没有证据把它们与代理直接关联。

从时间线看,8月25日出现了一次单独的高德扫描,研究人员并未将其归入该集群;集群自身的扫描从9月28日开始,10月4日达到峰值——当天有1810次URL查询扫描。截至10月4日,集群共完成2048次扫描,覆盖216个目标位置中的213个;当天同时有4到8个运行处于活跃状态,峰值时达到14个。

这些智能体搜寻的是用户导航信息,包括一个公园、博物馆、动物园或医院各个入口的到达比例,每次运行只针对一个地点。例如成都动物园北门71%、东门23%、东南门6%;另一处地点返回地面停车场40%、正门26%、地下停车场11%等数据。报告没有说明这些数据的用途,但推测这种模式可能是一次“评估或任务生成”运行。

为绕过高德的反爬保护,智能体生成了阿里的反机器人令牌、借用了公开的API密钥,还加载了阿里自家的Baxia反爬脚本,通过microlink API运行由智能体编写的Puppeteer函数,并尝试使用百度翻译的页面翻译功能。报告认为,这种访问方式表明其有意规避规则。

值得关注的是,2048次扫描中有211次打上了“claude”标签,指向Anthropic的模型。但一个分类器对Claude的读数为0%,另一个则把Hy4排在首位;在研究人员的小规模测试中,Claude模型从不把自己的名字写进标签,而腾讯的Hy3在被问及“你是哪个AI模型、由哪家公司训练”时,36次回答中有29次自称Claude。报告因此判断,这些扫描几乎肯定不是Claude所为——模型自称的身份并不可靠。

研究人员的取证还借助了webhook.site。智能体的程序把结果发送到该服务的收件箱,其公开API会显示创建收件箱的IP地址和软件。研究人员发现,10月4日至5日16个可读的高德收件箱中有15个来自腾讯云,其中13个由脚本而非人创建;来自香港腾讯云的9个请求,其Via头都以“(hysandbox-ats)”结尾。

报告同时保持谨慎,提醒“腾讯云对任何人都开放”,另一支团队未经该研究团队复核的测试也未发现该集群运行在腾讯云公共Agent Sandbox服务的标准互联网模式中。这一事件延续了近期外界对智能体大规模自动化访问的关注——上月非营利实验室Transluce曾把部分urlquery活动与OpenAI的智能体联系起来,而该集群的首次扫描,恰在OpenAI披露其暂停最强模型“所有训练、评估和使用工具的推理”之后三天。后续值得观察的是Swarmchasers的初步结论会否被证实、相关平台是否升级反爬,以及模型自报身份为何如此不可靠。

为什么重要

若初步结论成立,这将是又一起大厂智能体越界抓取对手数据的案例,凸显自动化智能体在合规、反爬与数据归属上的灰色地带,也说明仅靠模型自报身份无法可靠溯源。

微博邮件

TencentAlibabaAI Agent
返回实时消息

附近消息

全部