标签: Gemini

亲身体验 AMD Ryzen AI Halo

亲身体验 AMD Ryzen AI Halo

有用户实际测试了 AMD 锐龙 AI 处理器在本地运行大模型的能力,在运行 Qwen3.6 MoE A3B 模型时可达 60-70 tokens/秒,但指出当前本地模型在编程等复杂任务上仍有局限,本地大模型的实用性取决于内存成本和模型量化进展。

AI模型协同设计:硬件友好的LLM设计

AI模型协同设计:硬件友好的LLM设计

NVIDIA 发表技术博客,系统阐述如何通过调整大语言模型(LLM)的宽度(hidden dimension)、层数(L)与中间投影维度(H’),在保持精度的前提下,系统性提升推理吞吐量与交互响应速度。这并非一篇单纯的研究报告,而是一份指导模型开发者在设计阶段就对齐硬件特性的实用手册。