一句话看懂:墨西哥国立自治大学(UNAM)首次用 AI 摄像头监考远程入学考试,结果高分考生比例异常飙升,校方决定让约 5.8 万名考生重新线下考试。这起事件暴露了 AI 监考系统在大规模高利害考试中的可靠性危机。
事件核心:发生了什么
今年 5 月底至 6 月初,墨西哥最大的大学 UNAM 首次采用完全远程方式举行入学考试,约 16 万名申请者通过“锁定浏览器”加 AI 驱动的摄像头监考软件完成测试。成绩公布后,数据怪异:2021 年至 2025 年,120 题中得分 100 及以上的考生比例稳定在 3.5%,今年却飙升至 16.3%;得分 110 及以上比例从 0.9% 暴涨到 5.5%。高分异常引发大规模作弊指控,UNAM 随即成立专家委员会调查,最终给出的方案是增设一场线下“控制考试”,作为入学资格依据。
受影响的不仅是今年已被录取的考生,还包括 2021 年以来凭最低达标分数原本可进入相关专业的申请者,总人数约 5.8 万。UNAM 校长已向诚实考生道歉,称重考虽非其过错,却是“提供确定性和保障入学公平”的必要措施。目前课程仍定于 8 月 10 日开始,新考试安排细节尚未公布。
为什么重要
这不是一次普通的考试事故,而是 AI 监考技术首次在近 16 万人的国家级考试中大规模使用后出现的信任崩塌。AI 监考通常依赖计算机视觉和行为分析模型,从摄像头画面中识别可疑动作、视线偏移或异常交互。但这次事件表明,算法模型可能在远程环境下产生大量误判或漏判,而由此导致的高分异常又会反过来严重动摇公众对整个选拔制度的公信力。
更重要的是,UNAM 的应对方式等于公开承认:AI 系统的输出无法直接作为高利害决策的最终依据。对于教育科技公司、远程考试平台和正在将 AI 引入人事招聘、职业认证、在线面试等场景的企业而言,这是一个必须正视的警示——AI 监考的“准确率”在实验室里与真实考场中可能是两回事。
对用户/开发者/创作者的影响
对开发者来说,本次事故点出了问题不在“AI 能不能发现作弊”,而是“AI 在多大规模、多长周期、多大环境差异下还能稳定可信”。任何 AI 代理、行为分析或自动审核类产品,如果要在真实世界承担高风险判定,都需要设计人工复核、申诉通道和异常率监控机制,否则一次大规模失效就足以让整个产品线蒙上阴影。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对教育机构和考试采购方而言,选择 AI 监考工具不应只看演示效果,还要要求供应商提供误报率、异常分布数据和离线测试基准。对普通考生和求职者来说,这件事也说明:当你的升学、拿证或入职资格由算法参与决定时,你可能需要保留更多过程记录,以防算法出错后校方只要求重考,却不会补偿时间成本。
值得关注的后续
首先,UNAM 的新考试能否在 8 月 10 日开课前完成组织和评分,将成为这一方案可行性的直接检验。其次,专家委员会尚未公布高分异常的具体归因——究竟是普遍作弊、AI 监考被绕过,还是评分模型本身有缺陷?这份分析对 AI 监考产品改进至关重要。最后,其他采用类似 AI 远程监考的高校和认证机构是否会调整政策,是判断该技术路线走向的重要风向标。
来源:Slashdot


