若发现 ChatGPT 在背痛等健康问题上提供了更优质的建议,这背后可能归功于远在千里之外的执业医生。

每周超过 3 亿人使用 ChatGPT 获取健康建议。为引导 AI 在医疗领域的发展,OpenAI 征召了全球数百名精通 49 种语言的执业医生。这些签约医生负责评估用户或医患与聊天机器人的对话案例,识别可能导致误解或将用户置于身体危险中的环节。

Rebecca Soskin Hicks 于 2024 年加入 OpenAI,领导这项工作时担任“医生沟通者”,在医疗专家与公司之间搭建桥梁。她指出,医疗是高风险领域,“足够好”没有终点,团队将持续推动改进。

风险确实存在。今年七月,一名牧师因 ChatGPT 对其肺部健康危机的回应提起诉讼,指控 GPT-4o 模型误诊并淡化症状,要求 OpenAI 暂停运营健康相关产品。尽管相关法律环境尚未经充分检验,OpenAI 仍决定继续推进。健康产品负责人 Ashley Alexander 表示,AI 提供的建议优于互联网搜索,但将聊天机器人视为医疗决策的唯一依据是“过度简化”,可能阻碍其有益影响的普及。

Alexander 强调,ChatGPT 不应用于诊断和治疗,服务条款对此有明确说明,但机器人仍会协助评估疾病和受伤情况。

填补健康建议的“空白”

改善 ChatGPT 健康建议的任务由研究人员与医生共同承担。Soskin Hicks 与健康研究负责人 Karan Singhal 合作组建了医生团队。Singhal 希望患者将 ChatGPT 视为“护理旅程中的保护者”。该团队旨在引入地理多样性和多专业视角,成员作为兼职承包商分布在肯尼亚、尼泊尔和巴西等地。

截至七月,医生们已审查超过 70 万条 ChatGPT 回复,评估模型的改进空间。他们并不直接提供用于 AI 训练的数据,而是在评估后向研究团队指出“哪里存在空白,哪里表现可以更好”。随后,研究团队寻找新数据和训练方法,以提升 ChatGPT 在紧急分诊、信息收集、不确定性传达及回应详细程度上的准确性。

攀登健康 AI 的“证据阶梯”

目前,OpenAI 已实现 ChatGPT 与 Apple Health 及部分医疗记录的连接。Singhal 称赞最新的 GPT-6 Astra 模型在健康基准测试中达到“最先进水平”,公司上月还发布了针对心理健康回应的测试基准。

Soskin Hicks 表示,医生反馈和基准测试表现仅是证据链的第一步。她希望未来研究能证明,使用聊天机器人获取健康建议可切实改善个人和群体的健康结果。“我们正沿着证据阶梯向上攀登,但尚未到达顶端。”