celebrityanime

celebrityanime

GulliBench:衡量前沿模型的怀疑精神

GulliBench:衡量前沿模型的怀疑精神

Vetto Research 发布名为 GulliBench 的评测集,用 150 个刻意设置“表面数据在说谎”的简单任务,检验大模型是会盲目采信现成字段,还是愿意多一步验证。它提示:模型变聪明和变得可信,是两回事。

DeepSeek launches V4-Pro, its most advanced model that rivals Kimi K3 on some benchmarks at much lower prices, costing $0.44/1M input and $0.87/1M output tokens (Juro Osawa/The Information)

DeepSeek launches V4-Pro, its most advanced model that rivals Kimi K3 on some benchmarks at much lower prices, costing $0.44/1M input and $0.87/1M output tokens (Juro Osawa/The Information)

DeepSeek 于 2026 年 8 月发布最新模型 V4-Pro,在部分基准测试中与 Kimi K3 相当,但 API 定价显著更低:输入每百万 tokens 收费 0.44 美元,输出每百万 tokens 收费 0.87 美元。这是 DeepSeek 针对性价比区间的一次关键卡位。

holaboss-ai / holaOS

holaboss-ai / holaOS

开源项目 holaOS 发布了一个本地优先的 AI 代理工作区,让 Claude Code、Codex 等不同代理共用同一套记忆、工具和应用界面,并提供内置前沿模型或自带 API 密钥两种模型接入方式。这个项目把“代理碎片化”问题直接摆到了台面上:多代理协作能否成为下一个 AI 工作流常态。

Qencode MCP

Qencode MCP

Qencode 将其视频编码 API 通过 MCP(Model Context Protocol)协议对外开放,这意味着 AI 模型和智能体可以直接调用视频转码、压缩与处理能力,视频处理正从“人工调用接口”进入“AI 自动调度”的早期阶段。