随着生成式AI渗透至金融领域,用户依赖大模型获取财务建议已成常态。Intuit Credit Karma调查数据显示,66%的美国受访者在启用生成式AI前曾向其咨询理财建议,该比例在Z世代和千禧一代中高达82%。在所有应用场景中,财务管理占比41%,位居第二,仅次于健康领域(44%)。

然而,AI技术公司Saturn发布的“人工权威”研究报告对这一趋势提出警示。该报告对ChatGPT、Gemini、Claude和Copilot等18款主流AI工具进行测试,结果显示将AI作为财务顾问存在显著风险。

基准测试揭示高错误率

测试数据显示,AI模型在处理财务问题时错误频发。17个被测试模型的平均准确率仅为43%,错误率高达57%。在涉及税法规则及精确财务数据的复杂多步骤场景中,准确率骤降至12%,错误率飙升至88%。

付费模型的表现优于免费模型,前者失败率为49%,后者为63%。免费模型中,Claude Haiku 4.5表现最差,错误或不完备答案比例达82%;表现最佳的免费模型ChatGPT-5.6 Luna (max)错误率也达到56%。

在所有参测模型中,Anthropic的付费版Claude Opus 5 (reasoning)表现最优,通过率为61%。即便作为佼佼者,其在近四成案例中仍未能给出正确答案,且在面对复杂问题时错误率高达67%。

研究还列举了可能导致严重财务后果的错误案例:有模型声称大学毕业生移居海外可停止偿还学生贷款(实则可能增加月供);另有Gemini模型错误告知借款人,暂停抵押贷款还款不会影响信用评分。

用户信任面临考验

Saturn报告指出,当前AI提供的财务建议并不可靠,盲目依赖可能导致用户蒙受巨额经济损失。

安永(EY)今年3月发布的报告曾显示,53%的受访者倾向于使用AI助手进行投资决策,14%偏好完全自主的AI,33%表示拒绝使用。随着此类高风险错误被曝光,涉及债务管理、学生贷款、抵押贷款、养老金及税务规划等敏感问题时,用户顾虑或将加剧,进而推高拒绝使用AI或选择完全自主决策的比例。