LORA权重合并保存在本地之后重新加载出来,两个模型输出结果不一致

LoRA 权重合并后在本地保存,再重新加载,两个模型的输出结果不一致,通常出现在微调后合并、保存、再加载的流程中。优先排查 Transformers 版本以及 LoRA 合并/保存/加载时的模型状态与数据类型是否一致。

LoRA 权重合并后在本地保存,再重新加载,两个模型的输出结果不一致,通常出现在微调后合并、保存、再加载的流程中。优先排查 Transformers 版本以及 LoRA 合并/保存/加载时的模型状态与数据类型是否一致。

Modular 公司于 2026 年 8 月 11 日正式发布 Mojo 1.0,意味着这门面向 AI 和高性能计算的语言从快速迭代期进入稳定兼容期,开发者可以基于它构建长期项目。

一款名为 Suzanne 的 AI 工具声称能“设计和制造实体产品”,但在 Hacker News 上遭到技术人员集体质疑:它被指只是“ThreeJS + LLM”的演示级包装,并没有真正打通从提示词到可制造 CAD 模型的链路。这件事折射出当前 AI 设计工具普遍存在的宣传与工程现实之间的落差。

2022年Google邀请13位知名科幻作家参与一个由LaMDA模型驱动的AI写作工具研究,如今该研究被翻出,参与作家遭文艺界抵制,反映了创作者群体对AI版权训练问题的强烈不满。

Millennium Research 发布了一款名为 leanscreen 的开源工具,用于检查 Lean 4 定理陈述是否存在“空洞承诺”——比如证明能编译通过,但定理本身只是恒等式,实际意义为空。这类问题正是大模型生成形式化证明时最隐蔽的风险点。

OpenSSH 10.5 正式发布,团队同时公开表示欢迎 AI 辅助提交的安全漏洞报告,前提是有人工研判、测试用例或修复建议。开源安全社区对“是否接受 AI 进代码树”仍有明显分歧,但至少在漏洞挖掘环节,AI 已被权威基础设施项目官方接纳。

Cua 团队发现苹果 macOS 虚拟机中的虚拟 GPU 向应用上报了过于保守的 Metal 图形能力,导致 llama.cpp 在虚拟机里只能走慢速代码路径;他们用一个进程级兼容层修正能力报告后,LLM 推理速度提升 11–16 倍,接近物理机水平。

Meta 发布了 30B 参数的开源模型 Muse Glimmer,采用 Apache 2.0 许可证,专为 AI agent 场景设计,宣称在编程、多模态、安全、推理等跑分上领先同级模型,但因幻觉率较高,知识类任务仍是明显短板。

Cactus Compute 发布了 Needle 2,一个只有 14MB 大小、45M 参数的智能体大模型,专为手机、手表、智能家居和机器人等低成本设备设计,能在无 GPU、无 NPU 的环境下本地运行,Pebble 已经将其用在 Index 01 应用中。

一位开发者把 316 万参数的微型语言模型完整装进 250 美元的 FPGA 片上内存,绕开外部 DRAM,实测推理速度约 6 万 token/秒,比同一块板上的 CPU 快约 5000 倍,直观展示了