AI论文盲测:学生更青睐Gemini而非ChatGPT和Claude

盲测平台 StudyArena 对 6851 份学生投票的分析显示,在论文写作任务中,Google 的 Gemini 以 39.6% 的盲选率领先 Claude(31.8%)和 ChatGPT/OpenAI(29.2%)。更重要的是,学生偏好更长但推理强度更低的回答,这对大模型在写作场景的产品设计有直接参考意…

盲测平台 StudyArena 对 6851 份学生投票的分析显示,在论文写作任务中,Google 的 Gemini 以 39.6% 的盲选率领先 Claude(31.8%)和 ChatGPT/OpenAI(29.2%)。更重要的是,学生偏好更长但推理强度更低的回答,这对大模型在写作场景的产品设计有直接参考意…

一项针对学生的AI论文盲测显示,Gemini在写作任务中更受青睐,但数据同时表明,胜出的回答平均比落选者长37%——这场评测可能更多是“长度偏好”的胜利,而非模型真实能力的碾压。

IBM 发布开源企业级模型 Granite 4.2,首次在开放模型中原生加入推理能力,并用强化学习(RL)优化智能体任务执行——这意味着企业级模型不再只是“能聊天”,而是开始具备“会规划、能调用工具”的自主工作能力。

AI 智能体的上下文管理正在从“无限拉长窗口”转向“压缩+预测”的架构方案。开发者对 Synap 这类工具的质疑集中在文档兼容性、是否优于 RAG 以及本地化部署能力上。

OpenAI CEO Sam Altman 在播客采访中再次表达对 AI 权力集中的担忧,主张“人类深度掌控未来”,并明确反对政府严格监管 AI,强调自由和开放模型的重要性。这番表态将 OpenAI 与 Anthropic 等竞争对手的安全优先路线直接对立。

OpenAI 数据中心负责人 Chris Malone 上任仅一年多便离职,成为该公司今年第 13 位离任高管。在 AI 算力军备竞赛白热化的当下,核心基建岗位的人事震荡,直接关系到 Stargate 项目等千亿美元级计划的执行节奏。

谷歌于本周二正式发布面向律所和法律从业者的 Gemini Enterprise for Legal,将 Gemini 平台的能力延伸至法律垂直场景,直接对标 Anthropic、Thomson Reuters 等厂商在该领域的布局。

据 X 平台爆料,OpenAI 已完成代号 Bel 的新一代大模型预训练,参数量超过 10T,定位是 GPT-6 之后的基座模型,并被视为冲击 AGI 的关键一步。目前信息来自非官方渠道,OpenAI 尚未确认。

SpaceX 以 60 亿美元完成对 AI 编程工具公司 Cursor 的收购,马斯克在内部全员会上承认 AI 部门落后于 Anthropic 等对手,并宣布将深度整合团队、继续大规模采购算力。这笔交易意味着编程工具赛道的竞争正式进入巨头主导的算力比拼阶段。

Anthropic 在 IPO 前释放重磅信号:其总潜在市场规模(TAM)估值超过 30 万亿美元,2028 年收入预期高达 2000 亿美元。这一数据直接对标全球顶级科技公司,为即将到来的资本市场定价构建叙事基础。