浏览器中的1-Bit LLM

开发者正在尝试在浏览器中直接运行 1-Bit 量化的大语言模型(如 Qwen、Gemma),并通过 WebGPU 技术实现推理。虽然目前还远未达到可用速度,但这条路展示了大模型在端侧落地的另一种可能。

开发者正在尝试在浏览器中直接运行 1-Bit 量化的大语言模型(如 Qwen、Gemma),并通过 WebGPU 技术实现推理。虽然目前还远未达到可用速度,但这条路展示了大模型在端侧落地的另一种可能。

开发者通过接入魔珐星云具身驱动 SDK,为纯文本 AI Agent 装上了能实时响应的 3D 数字人身体,实现语音、口型、表情和动作的同步输出,端到端延迟控制在 500ms 左右,并支持对话打断。

无问芯穹在2026年世界人工智能大会上发布“Agentic Infra”战略,试图用一套“前店后厂一中心”的基础设施架构,解决算力碎片化和智能体应用爆发带来的效率瓶颈。其核心创新包括跨异构集群的PD分离推理架构和跨域强化学习系统,目标是让大模型推理成本再降10倍。

AI 初创公司 Moonshot 因 GPU 算力在 48 小时内被抢光,暂停了新用户对其最新模型 Kimi K3 的订阅。这一事件说明,即使开源模型盛行,高性能推理的算力瓶颈仍是商业化最直接的挑战。

中国AI公司月之暗面(Moonshot AI)发布了Kimi K3 open-weight模型,其核心策略是通过强化“记忆”能力降低对算力的依赖,这一技术路线在目前中国大模型竞赛中较为独特,值得关注它对长文本处理场景和推理成本的直接影响。

小红书与北大联合开源 UltraEP,它能在每个微批次和每一层动态复制热点专家,将大规模 MoE 模型训练和推理的吞吐提升至理想性能的 94% 以上——解决了此前专家并行中 GPU 负载不均、大量算力被白白浪费的核心痛点。

SK集团会长崔泰源表示,高性能内存的持续短缺已迫使多国政府介入扶持本国产业,SK海力士必须加快产能扩张以应对AI算力需求。这一表态揭示了全球AI芯片供应链正从市场驱动转向政策驱动的关键转折。

投资者担心存储芯片厂商大规模扩产将导致产能过剩,但另一方认为,AI 模型训练和推理对高带宽内存(HBM)的持续需求,可能打破存储行业传统的周期波动规律。这直接影响了相关公司股价和行业投资逻辑。

随着AI基础设施建设投入持续膨胀,大型科技公司的资本支出正遭遇投资者质疑。市场信号显示,若不能清晰证明这些巨额投资能转化为收入和利润,财报季的股价抛售可能只是开始。

摩根士丹利2026年上半年在股权和债务资本市场获得23亿美元费用收入,较2025年同期的14亿美元增长约64%,主要驱动力来自为AI基础设施项目提供融资服务。这一数据直接反映出全球资本正在大规模涌入AI算力建设。