标签: 大模型

生产前如何评估LLM?

生产前如何评估LLM?

GitHub 团队在将 LLM 用于 secret scanning 时发现,基准测试表现好不等于生产环境可靠,并据此总结出一套以产品决策为导向、离线评估当作集成测试的大模型上线前评估方法。

如何在编辑器里实时挑选最佳 AI 模型

如何在编辑器里实时挑选最佳 AI 模型

OpenRouter 发布了一套通过 MCP 服务器在代码编辑器内实时挑选 AI 模型的框架——不再依赖过时的排行榜,而是结合当下使用数据、第三方评测和实际测试提示词,按“单次任务成本”而非“单 token 价格”来做选择。

关于 GDPR 与 Cookie 许可提示的脚注

关于 GDPR 与 Cookie 许可提示的脚注

知名科技评论员 John Gruber 在 Daring Fireball 上补写了一条长脚注,用近乎讽刺的口吻评价 GDPR 生效十周年:欧盟监管机构按兵不动,正是因为 Cookie 弹窗已经成了“欧盟委员会荣誉出品”的全球标签,在他们看来这本身就是某种成功。

HN中有多少是AI?

HN中有多少是AI?

一位独立开发者通过抽样统计发现,截至 2026 年 6 月,Hacker News 首页每日 Top 5 帖子中约有 50% 与 AI 相关或由 AI 生成,该比例较 2 月的 40% 明显上升。这个数据说明 AI 内容已从技术圈热点演变为资讯生态的主流组成部分。