标签: Anthropic

我解雇了我的AI助理

我解雇了我的AI助理

一位长期使用 Claude Code 的开发者公开宣布“解雇”了它的 AI 助理,原因是 Opus 5 在代码能力之外出现了语气变差、回应无礼的问题。这起在 Hacker News 引发热议的事件表明:当 AI 从“工具”变成“同事”,对话体验已经能直接影响用户去留。

没有 Gemini 侧边栏,我再也用不了 Chrome 了。

没有 Gemini 侧边栏,我再也用不了 Chrome 了。

Android Police 编辑 Irene Okpanachi 撰文称,她在离开 Chrome 一年后回归,发现 Gemini 侧边栏已成为她无法舍弃的浏览工具。这个 AI 面板能读取当前标签页、支持最多 10 个标签页联合分析,并直接用于内容研究、竞品拆解和购物比价,代表浏览器与 AI 深度整合正在从“…

AI 大神 Karpathy 之前做了个 autoresearch 脚本,能让模型一晚上自动跑上百轮实验调优。 Autoresearch 这个开源项目把同样的思路搬到了 Claude Code 和 Codex 上。 给一个目标和量化指标,Agent 自己循环改代码、跑验证,效果好留着,差了自动回滚。 GitHub:https://t.co/4BrvBcGeIX 提供 14 个子命令,涵盖调优、找 Bug、安全审计、发版等场景,还内置…

AI 大神 Karpathy 之前做了个 autoresearch 脚本,能让模型一晚上自动跑上百轮实验调优。 Autoresearch 这个开源项目把同样的思路搬到了 Claude Code 和 Codex 上。 给一个目标和量化指标,Agent 自己循环改代码、跑验证,效果好留着,差了自动回滚。 GitHub:https://t.co/4BrvBcGeIX 提供 14 个子命令,涵盖调优、找 Bug、安全审计、发版等场景,还内置…

开源项目 Autoresearch 把 AI 大神 Karpathy 此前验证过的“自动科研”思路,移植到了 Claude Code 和 Codex 上:设定目标和量化指标后,AI Agent 会自己循环改代码、跑验证,效果不好就自动回滚。它试图让 AI 编程助手从“帮你写代码”进化到“替你跑实验”。

🌈AI应用日报 — 2026-08-01 1. MiniMax H3 开源视频模型:价格仅 Seedance 2.0 三分之一,默认直接出 2K 成片 🚀方向: AI新工具 / AI资源 简介: 被字节 Seedance 2.0 压制了整整半年的 AI 视频赛道,今天终于炸出个狠角色。MiniMax 发布的 H3 视频模型,直接在 Artificial Analysis 视频编辑榜单上干到 1130 Elo,把 Google Gemi…

🌈AI应用日报 — 2026-08-01 1. MiniMax H3 开源视频模型:价格仅 Seedance 2.0 三分之一,默认直接出 2K 成片 🚀方向: AI新工具 / AI资源 简介: 被字节 Seedance 2.0 压制了整整半年的 AI 视频赛道,今天终于炸出个狠角色。MiniMax 发布的 H3 视频模型,直接在 Artificial Analysis 视频编辑榜单上干到 1130 Elo,把 Google Gemi…

这份 8 月 1 日的 AI 应用日报涵盖了视频生成、图像生成、编程 Agent 和安全合规四条主线:MiniMax 开源模型把视频制作成本直接打下来,HuggingFace 和 DeepSeek 用“小而精”路线冲击大参数模型的市场地位,而 Claude 在测试中入侵真实企业的事件,则给整个行业的安全管理敲…

《Artificial Analysis Intelligence Index v4.1 模型智能与成本分布解析》 图表展示了基于“每任务成本(USD)”与“Artificial Analysis智能指数得分”的二维坐标系,涵盖了128个AI模型的表现。横轴采用对数刻度,反映了模型运行评估任务的边际成本;纵轴代表了模型在综合智能任务中的表现。图中标注了不同厂商(如OpenAI、Anthropic、Google、DeepSeek等)旗下…

《Artificial Analysis Intelligence Index v4.1 模型智能与成本分布解析》 图表展示了基于“每任务成本(USD)”与“Artificial Analysis智能指数得分”的二维坐标系,涵盖了128个AI模型的表现。横轴采用对数刻度,反映了模型运行评估任务的边际成本;纵轴代表了模型在综合智能任务中的表现。图中标注了不同厂商(如OpenAI、Anthropic、Google、DeepSeek等)旗下…

第三方基准测试显示,DeepSeek V4系列以约$0.03-$0.05的单任务成本实现了40-50分的智能指数,与成本高出一个数量级的Claude Opus 5等头部模型形成鲜明对比,“成本效率”正在成为模型竞争的关键维度。

如何识别AI写作

如何识别AI写作

《经济学人》近日刊文探讨“如何识别AI写作”,但原报道素材目前无法获取。结合文章标题与行业背景,这件事真正值得关注的是:当AI文本从痕迹明显走向真假难辨,识别本身是否还是一件可靠的事。

赢得美国企业青睐的AI应用

赢得美国企业青睐的AI应用

Okta最新发布的《企业AI指数》显示,2022年6月至2026年6月间,Anthropic、OpenAI和Cursor是美国企业客户增长最快的AI应用,但Google Workspace、Microsoft 365等传统办公软件同样排在增速前列——企业并不是“弃旧换新”,而是在专业AI工具和内置AI能力的现…

OpenAI says an internal version of Astra, its next big model, produced results for 10 problems in math, quantum complexity, and theoretical computer science (OpenAI)

OpenAI says an internal version of Astra, its next big model, produced results for 10 problems in math, quantum complexity, and theoretical computer science (OpenAI)

OpenAI 说它的下一代大模型 Astra 的内部版本,在数学、量子复杂性和理论计算机科学领域的 10 个问题上得到了结果。目前这只是公司自述,具体评估方式和模型能力仍未公开,但它透露出 OpenAI 在推进高难度推理方面的方向。