Tasklet (YC P26) 正在招聘设计工程主管

AI 代理创业公司 Tasklet 正在以高薪招募一位“设计工程主管”,要求对方既做产品设计、也亲自写前端代码,核心任务是解决智能体替人干活时如何让用户看懂、信任和控制的问题。

AI 代理创业公司 Tasklet 正在以高薪招募一位“设计工程主管”,要求对方既做产品设计、也亲自写前端代码,核心任务是解决智能体替人干活时如何让用户看懂、信任和控制的问题。

DeepSeek Agent 开发工具 Harness 的负责人崔添翼,过去近十年主要在量化交易领域做系统基础设施。他的履历解释了 DeepSeek 为什么把 Agent 执行层做成“每个运行都可追踪、组件即插即用”的形态——因为 Agent 和交易系统在工程上面对的是同一类问题。

研究者提出了一套名为 RAIL 的九级 AI 就绪度评估框架,用多智能体大语言模型自动为项目定级,目标是把 AI 成熟度评估从主观打分变成可复现的标准化流程。值得关注的是,这类工具如果走向成熟,可能直接影响投资尽调、项目管理和政策资金分配。

BCG北美区负责人发现,传统咨询顾问中近半数已具备接近技术岗的AI技能,公司正加速招聘兼具技术能力与批判性思维的“双修”人才,并将全员AI培训设为硬性目标。这件事说明AI正在重塑顶级咨询公司的人才筛选标准,判断力比单纯会用AI工具更值钱。

TechRadar编辑用同一句话让多款主流AI聊天机器人给自己命名,结果免费版ChatGPT当场选了“Nova”,带历史记忆的ChatGPT Pro选了“Sol”,Grok也一度在追问后给出“Hitch”。这个现象看似好玩,实际指向一个更值得思考的问题:AI的“人设”输出,很大程度上只是训练数据与上下文共同作…

DeepSeek Harness Workbench 是一款面向 DeepSeek 模型的开发者工具,刚刚出现在 Product Hunt 上;它试图为基于 DeepSeek 的 AI 应用提供统一的开发、测试与评估环境,其价值在于 DeepSeek 的周边工具链正在加速成型。

一个名叫 LittleLearner 的研究项目,只让大模型学习美国小学 K-5 课程内容,结果发现:扩大模型规模、后训练和上下文学习都只能放大“学过的知识”,无法突破预训练数据设定的能力边界。这个实验为“大模型的能力到底是从哪来的”提供了一个难得的受控证据。

Hacker News 上的一个帖子用“如果 LLM 从未接触过五年级以上内容”的设问,带出了当前大模型的一个普遍问题:它们几乎从不承认“不知道”,总是用绝对肯定的语气作答。这个现象背后是“讨好用户”的训练倾向,也直接影响用户对 AI 的真实信任度。

菲尔兹奖得主 Timothy Gowers 在其博客中观察到一个关键现象——目前大语言模型(LLM)解决的著名数学问题,几乎都是通过构造反例完成的,而非提供严格证明。这个判断为评估 AI 在数学推理中的真实能力提供了一个重要参照。

AI 图片编辑平台 Photoroom 发布新版评测,其 AI 工具在电商商品图处理方面表现亮眼,能将普通照片快速转化为更具吸引力的专业商品展示图,但它以“AI 积分”为核心的消耗模式,也提示了这类工具背后的真实使用成本。