一位独立研究人员发现,OpenAI快速增长的广告业务背后似乎运行着一个跨站追踪系统。该系统的核心是一个名为“__obi”的Cookie,据称能从ChatGPT传播至部署了OpenAI广告技术的第三方网站。

这意味着,若用户使用ChatGPT后访问参与该计划的零售商或其他网站,OpenAI可能识别出同一浏览器,并获取用户在站内的活动信息。这一发现正值OpenAI加速扩张广告业务之际。该公司最近推出了新的AI驱动广告工具和赞助代理(Sponsored Agents),并宣布ChatGPT广告的年化收入已达到10亿美元。

不过,这并不等同于ChatGPT正在监视用户的所有在线活动。该项研究存在重要局限,包括研究人员无法独立验证系统中的关键部分。

什么是“__obi”?

这项研究由署名为Buchodi的独立研究人员发布。他分析了涉及936个OpenAI广告像素、跨越1,029个主机名的数月网络流量。

分析显示,访问ChatGPT可能导致OpenAI在浏览器中植入名为“__obi”的Cookie。Cookie本身并不罕见,常用于保持登录状态、记住偏好或衡量广告效果。但该Cookie的配置方式引人注目:Buchodi发现,“__obi”有效期长达一年,且采用SameSite=None设置,允许其在源自其他网站的请求中被包含。

这正是OpenAI广告系统的运作机制。通过ChatGPT投放广告的企业可在其网站安装OpenAI测量像素,类似Google和Meta等平台的追踪技术。当Buchodi访问参与网站时,发回OpenAI的请求中包含了“__obi”标识符。换言之,ChatGPT创建的标识符可能在浏览器访问其他网站时再次出现。

OpenAI能获取哪些数据?

根据Buchodi的网络分析,OpenAI广告收集器接收的信息不仅限于用户是否访问某网站,还包括页面访问情况及转化事件。

研究人员检查了23,929个观察到的URL,发现查询字符串在发送给OpenAI前被剥离,但URL路径得以保留。URL路径往往揭示大量内容信息,数据集中涉及医疗状况、债务服务和诉讼登记等敏感页面。

此外,该系统支持OpenAI所谓的“转化测量”功能。官方文档指出,广告商可利用此功能追踪用户在与ChatGPT广告互动后的跨网站、应用甚至线下活动的转化与归因。这是数字广告的标准做法,但不寻常之处在于,广告平台与一个可能承载更多个人上下文的AI助手并列。

是否与ChatGPT账户关联?

Buchodi发现,标识符生成过程使用了标记为“account_user”或“anonymous”的令牌。在解码的932个令牌中,736个与已登录用户相关,196个被标记为匿名。匿名标识符在同一设备上至少可稳定存在27天。

然而,关键限制在于:Buchodi并未直接观察到OpenAI将广告商网站收到的事件与服务端的ChatGPT账户进行关联。虽然架构使得这种连接成为可能,但最终的服务端步骤未被独立证实。因此,断言OpenAI将用户在第三方站点的浏览记录明确附加到其ChatGPT个人资料尚为时过早。

测试期间,该标识符出现在多个知名网站。在一个设备上,同一“__obi”值从12个使用13个独立广告像素的商业网站发送给了OpenAI。在更大样本中,30个标识符中有12个出现在多个广告商处,其中一个出现在10个不同广告商处。

研究还存在其他局限:测试仅在Android版Chrome上进行,未涵盖桌面版;Safari及iOS浏览器的反追踪保护会阻止此类第三方Cookie机制;此外,并非每次ChatGPT会话都会生成该标识符,估计比例约为五分之一。

官方回应与争议焦点

OpenAI尚未公开回应这些具体发现。Buchodi表示,其于9月14日联系OpenAI新闻和隐私团队,询问“__obi”为何被归类为分析Cookie以及在用户拒绝营销Cookie时的运作机制。OpenAI确认收到咨询并称将转达内部部门,但在研究发布时尚未作答。

OpenAI公开文档强调,广告商无法获取ChatGPT对话、聊天记录、记忆或个人细节,公司也不向广告商出售用户数据,仅提供浏览量、点击量和转化率等聚合报告。

这一区别至关重要:研究并表明广告商能读取用户对话或访问“__obi”标识符。担忧的核心在于信息流向的反转——即数据从使用OpenAI广告工具的网站回流至OpenAI。

为何此事重要

跨站广告测量并非新鲜事,Google、Meta等公司多年来一直构建此类系统以追踪广告转化。但ChatGPT引入了新维度:用户不仅用它搜索产品,还讨论人际关系、健康、财务及职业规划等私密话题。

OpenAI在向广告商推广时,恰恰强调用户在ChatGPT中分享了“更丰富的上下文”。因此,ChatGPT活动与网络其他行为之间的界限变得至关重要。目前证据未显示OpenAI将对话交给广告商,但“__obi”的发现提出了一个新问题:当用户离开AI平台后,有多少信息应当回流至平台本身?