
SmartBear发布的《2026年软件质量与测试现状》报告显示,AI在软件质量信心上存在显著裂痕:尽管81%的组织领导者认为AI能可靠地自查错误,但仅有64%的软件从业者对此表示信任。
这种认知偏差在实践中尤为明显。调查指出,46%的团队曾发布过后期出现问题的AI生成代码,但在这些团队中,仍有69%对代码按预期运行抱有高度或完全信心。报告强调,无论工具如何演进,开发人员与工程师仍需对最终交付成果负责,确保其符合管理层期望。
验证机制不可或缺
随着AI代码生成速度激增,建立全生命周期的检查机制至关重要。这包括对AI生成内容进行人工审查,以确保功能符合设计意图且无缺陷。
开发者与管理层在测试信任度上分歧巨大:56%的开发者更信任人类编写的测试用例,而72%的管理者则信赖AI测试。目前,组织尚未准备好完全淘汰测试人员。数据显示,仅3%的受访者完全依赖AI自我验证,84%的团队至少采用一种形式的人工审核。值得注意的是,92%的受访者视AI为主要代码测试者,但48%的人认为此举必须在人类监督下进行。
报告指出,AI自测的主要风险在于“黑盒”效应。若审查人员不了解AI依据的具体规范,便无法有效验证代码。“由同一系统既生成又验证代码,使得测试逻辑和内置假设对人类监督者而言不可独立解读。”团队因此缺乏独立信号来确认测试覆盖率的有效性,难以区分真正的质量保证与AI的自我确认。
三阶段独立检查策略
随着“左移”测试成为常态,结合AI技术,组织正转向三阶段测试方法:
生成前:46%的受访者会在AI生成代码前,检查规范是否准确反映代码意图。报告认为,这是发现问题最早且成本最低的环节。
提交前:49%的团队会对超过60%的AI生成代码进行独立审查。
发布前:60%的受访者表示,会在发布前对超过60%的AI编写代码进行独立测试。
报告强调,在软件开发生命周期后期修复错误的成本最高。虽然AI提升了测试覆盖率,但并未必然解决成本问题。彻底的测试旨在将问题消灭在消耗大量工作资源之前。