万字长文!读懂模型微调的基本概念和名词

一篇面向普通用户的长文系统梳理了模型微调的基本概念,把预训练、基础模型、后训练和微调这几个经常混用的词讲清楚了。它有助于降低大模型定制化的认知门槛,尤其是对想用本地数据训练专属模型的个人或小团队。

一篇面向普通用户的长文系统梳理了模型微调的基本概念,把预训练、基础模型、后训练和微调这几个经常混用的词讲清楚了。它有助于降低大模型定制化的认知门槛,尤其是对想用本地数据训练专属模型的个人或小团队。

路透社调查发现,美国多地数据中心申请的电网用电量远超实际需求,出现大量“幽灵用电”,得州已暂停新数据中心接入并启动审计,多州跟进整治。

腾讯旗下操作系统级AI助手Marvis于9月1日上线“自定义模型”功能,允许用户接入Kimi、智谱GLM、DeepSeek等第三方大模型及本地开源模型,并支持多端同步。这意味着AI助手与底层模型正式解耦,用户不必更换应用即可自由切换不同模型。

GitHub 调整了 Copilot 模型访问权限的判定逻辑:当用户同时属于多个组织时,只有承担计费的那个组织所启用的模型才能被使用。这意味着企业治理规则将直接决定开发者能调用哪些大模型。

Hugging Face 发布了一组包含 207 个 WebGPU 内核的开源工具包,试图把浏览器里的本地 AI 推理速度拉高一个台阶。这相当于把 GPU 的底层操作做成标准化模块,供开发者直接调用。

arXiv 数学板块今日新增投稿近 600 篇,其中大量论文被指为 AI 生成的低质量内容。这并非单纯的学术八卦,而是 AI 工具大规模滥用正在改变学术出版生态的信号。

一位前端技术专家在多个中型企业级项目中,用 8 个 AI 编码 Skill 把需求评审到 Bug 修复的完整链路串了起来,并总结出一套可落地的“Harness 工程”方法论。这套方法的核心不是让 AI 更快,而是用标准化流程和目录结构,把 AI 的产出“固定”下来,解决多角色协作中的断档和返工问题。

一位开发者用 DeepSeek 实际完成项目后发现,AI 代码生成速度虽快,但质量堪忧;同时他引述行业观点指出,AI 编程工具让创业者误以为不再需要技术负责人,导致大量缺乏维护与安全能力的软件正在泛滥。

Anthropic 与一家知名度不高的云计算公司 Lambda 签下 350 亿美元算力协议,用于德州一个由前比特币矿商建设的数据中心。这笔交易背后,Nvidia 以投资方、场地租约方和芯片供应商三重身份出现,反映出当前 AI 算力争夺战已经从单纯的采购变成了基础设施层面的深度绑定。

OpenAI 在针对苹果商业秘密诉讼的最新回应中,反指苹果自身的数据管理政策“制造了混乱”,并否认窃取任何硬件机密。这场纠纷不仅关乎两家巨头的人才争夺,也可能直接影响 OpenAI 硬件项目的推进节奏。