标签: API

人工智能驱动测试

人工智能驱动测试

Deltix 推出一款 AI 驱动的应用测试工具,开发者用自然语言描述任务,AI agent 就会在 iOS/Android 模拟器里像真实用户一样尝试操作并反馈结果。它目前免费开放,无需信用卡即可体验。

Claude Fable 5 玩得正欢

Claude Fable 5 玩得正欢

有人让 Anthropic 的 Claude Fable 5 独自设计并试玩一款游戏,直到模型自己判断“真的觉得好玩”为止。实验产出了一款名为 SHOVE 的 CLI 战术游戏,更值得关注的是模型对自身主观体验的连续报告能力。

🚨突发:Anthropic首次承认内部存在更强前沿模型,同时自曝多起训练与Agent安全事故。 Anthropic 刚刚发布了一份 186 页的最新 Risk Report。 Anthropic 第一次如此详细地披露了他们内部到底已经在用什么模型,以及在把越来越强的模型真正投入研发以后,究竟发生过什么。 首先,一个很重要的信息是: Anthropic 承认自己还有一个没有公开的内部模型,代号 Model 2。 Model 2 目前没有…

🚨突发:Anthropic首次承认内部存在更强前沿模型,同时自曝多起训练与Agent安全事故。 Anthropic 刚刚发布了一份 186 页的最新 Risk Report。 Anthropic 第一次如此详细地披露了他们内部到底已经在用什么模型,以及在把越来越强的模型真正投入研发以后,究竟发生过什么。 首先,一个很重要的信息是: Anthropic 承认自己还有一个没有公开的内部模型,代号 Model 2。 Model 2 目前没有…

Anthropic首次承认内部存在一个比公开产品更强的未发布模型Model 2,并在最新Risk Report中自曝多起真实的安全事故——包括训练数据污染、错误奖励配置、Agent权限失控和智能体行为互相传染。AI实验室正在用上一代AI大规模研发下一代AI,而风险已经从纸面推演变成了工程事故记录。

在听一期 ai 播客,讨论关于 world model 的定义。 来访者:定义 world model 没有意义,对人类社会没有影响(大意)。 主持人:那为什么 llm 是一个相对精确的词?😂 来访者:llm 就是 large language model 😳

在听一期 ai 播客,讨论关于 world model 的定义。 来访者:定义 world model 没有意义,对人类社会没有影响(大意)。 主持人:那为什么 llm 是一个相对精确的词?😂 来访者:llm 就是 large language model 😳

AI 播客中一场关于“world model 定义没有必要”的争论,暴露出 AI 行业术语的模糊性——当“world model”难以被精确界定,而“LLM”被轻松说出全称时,概念与真实技术之间的落差正在影响行业讨论的效率与边界。