标签: LLM

GitHub Spark 在 github.com 上即将弃用

GitHub Spark 在 github.com 上即将弃用

GitHub 宣布其 AI 应用快速开发工具 Spark 将于 2026 年 8 月逐步在 github.com 上关停,用户须在 8 月 31 日前导出代码。这一调整本质上是将 AI 应用开发能力并入 GitHub Copilot 生态,而非彻底放弃该方向。

Homebench – 基准测试本地LLM的速度、内存和质量

Homebench – 基准测试本地LLM的速度、内存和质量

独立开发者发布了一款名为 Homebench 的开源本地大模型基准测试工具,它的特别之处不是“跑分”,而是从速度、内存、质量三个维度诚实讨论当前本地 LLM 评测的常见误区。目前公开信息显示,该项目刚在 Hacker News 上发布,已可以通过 pip 直接安装。

一个工程师,一周时间,构建了一个全公司使用的 AI 助手——然后它一周内达成季度采用目标,如今每周使用率超过八成。 《Stripe 如何在 Deep Agents 上构建 Kai》 Stripe 是全球支付和金融基础设施平台,被数百万企业使用。为了支持产品的大规模持续发布和迭代,他们构建了帮助 Stripe 全体员工提高生产力的 AI 工具。Stripe 的 AI 平台团队负责为公司所有 AI 应用提供动力的技术栈。他们最显眼的产品是…

一个工程师,一周时间,构建了一个全公司使用的 AI 助手——然后它一周内达成季度采用目标,如今每周使用率超过八成。 《Stripe 如何在 Deep Agents 上构建 Kai》 Stripe 是全球支付和金融基础设施平台,被数百万企业使用。为了支持产品的大规模持续发布和迭代,他们构建了帮助 Stripe 全体员工提高生产力的 AI 工具。Stripe 的 AI 平台团队负责为公司所有 AI 应用提供动力的技术栈。他们最显眼的产品是…

Stripe 的 AI 平台团队用 LangChain 开源的 Deep Agents 框架,让一名工程师在一周内构建出全公司使用的 AI 助手 Kai;上线一周就达成季度采用目标,目前已有 83% 的 Stripe 员工每周使用它。

LLM奖励专业知识

LLM奖励专业知识

Hacker News 上一篇题为“LLM奖励专业知识”的讨论,聚焦一个尖锐问题:模型能快速回答表面问题,却很难帮你建立起对特定代码库的深度理解。真正能用好 LLM 的人,往往是那些已具备领域知识、把模型当思考扩展件而非替代品的人。

LLM奖励专业知识

LLM奖励专业知识

一个被反复讨论的观点被重新验证:同样一个LLM,围棋高手和初学者用出来效果完全不一样。决定AI输出质量的关键,不是“提示词技巧”,而是你在相关领域是否真的懂行。

OpenRouter 推出 Ori Eval 简化评估流程

OpenRouter 推出 Ori Eval 简化评估流程

OpenRouter 推出了一款名为 Ori Eval 的评估代理,能自动扫描你的代码库、找出模型调用点、写出评测用例并对候选模型打分排名。它把过去需要专门搭框架的评估工作压缩成一次自然语言交互,直接降低了开发者选模型的门槛。