AI在速度和准确性上胜过持证会计师,但仍无法在无人监督下完成结账

Mercor 的最新测试显示,AI 大模型在结构化记账任务上的速度和准确率已全面超过持证会计师,但在完整结账流程中仍需人工监督,无法独立完成。

Mercor 的最新测试显示,AI 大模型在结构化记账任务上的速度和准确率已全面超过持证会计师,但在完整结账流程中仍需人工监督,无法独立完成。

The Verge 报道称,ChatGPT 等生成式 AI 的幻觉正在让服务业一线从业者陷入更尴尬的处境——顾客拿 AI 的错误答案当权威,反过来质疑服务员、护林员甚至儿科专业人士。这暴露了大模型落地消费场景时,准确性和信任边界比功能本身更难处理。

据《华尔街日报》报道,OpenAI 解雇了三名被指将公司敏感信息泄露给外部 AI 安全机构的研究员,另有一名安全方向研究员随后离职。这四人此前都曾公开谈论 AI 风险,事件把“安全团队与公司路线之间的张力”再次推到台前。

NVIDIA 为 DGX Spark 增加了 64GB 统一内存版本,10 月 23 日起由宏碁、华硕、戴尔、技嘉、惠普和微星等厂商开卖,起售价 4,999 美元,让开发者能以更低门槛在本机运行最高 1000 亿参数的大模型。

GitHub 为仓库安全公告引入“机密评论”,只有拥有仓库写权限的维护者可见,漏洞报告者和被邀请的外部协作者都看不到。这意味着安全团队终于可以在公告内讨论可疑滥用、调查细节和协调节奏,而不必把对话搬到 Slack 或邮件里。

DeepSeek 推出了 Harness 桌面版,同时支持 macOS 和 Windows,把原本偏工程化的模型调用与实验流程搬到了本地桌面,对想上手大模型推理和开发的用户来说,门槛又低了一截。

DeepSeek 上线了一个名为 Harness 的新页面,主打"一切皆插件"的界面扩展能力,用户可以直接用自然语言对话让 AI 现场编写、安装并验证插件。这释放出的信号是:AI 助手正从"回答问题"转向"改造自己的工作台"。

Meta 首席 AI 科学家 Yann LeCun 在 Fortune 访谈中表示自己对 AI 导致人类灭绝“零担忧”,并直言 Anthropic CEO Dario Amodei 在网络安全问题上“活在幻想中”“疯狂”。这番表态把“AI 安全派 vs 技术乐观派”的路线分歧再次推到台前。

掘金作者 SFLYQ 在 2026 年 9 月 29 日发布文章,分享了一套名为 internal-mcp 的内网 AI Agent 工程方案:不改动现有内网系统的前提下,把内网 API 封装成 MCP Tools 供 AI 调用,并用审批、留痕、凭据托管来兜底风险。

9 月 29 日 OpenAI 开发者大会发布常驻智能体 Dots,自带云电脑、可长期在岗;同一时期字节豆包工作也在推多智能体并行与操作电脑能力。两家大厂正把 AI 从“临时问答工具”推向“长期在岗员工”,对普通用户来说,关键门槛不在技术,而在会不会写清楚岗位说明书。