Misc. bug: llama-cli or llama-server seem to have no way to save a transcript to a file

用户运行 llama-cli 或 llama-server 与 LLM 交互(从 Hugging Face 下载 GGUF 模型),对话结束后希望将完整对话内容(包括用户输入和模型回复)保存到文件中,但找不到对应的命令行选项或交互指令(如 /save )。用户尝试使用 tee 重定向 stdout

用户运行 llama-cli 或 llama-server 与 LLM 交互(从 Hugging Face 下载 GGUF 模型),对话结束后希望将完整对话内容(包括用户输入和模型回复)保存到文件中,但找不到对应的命令行选项或交互指令(如 /save )。用户尝试使用 tee 重定向 stdout

Google 正式发布 LiteRT.js,这是一个通过 WebAssembly 将端侧推理引擎 LiteRT 搬进浏览器的 JavaScript 绑定库,让开发者直接在网页中运行 .tflite 模型,实现接近原生性能的 AI 推理,同时保证用户隐私和零服务器成本。

Simon Willison 发布了 LLM-元-AI 0.1 这一试用版本,正式支持通过 LLM 工具调用新兴的 muse-spark-1.1 模型。这意味着开发者现在可以在熟悉的 LLM 工作流中直接对接这个此前较为封闭的模型,值得关注其实际性能与生态扩展潜力。

LinkedIn 正被大量 AI 生成的虚假招聘、伪成长帖和刻意的营销内容淹没,用户普遍反馈平台已丧失专业讨论价值,本质上是微软复制 Facebook 增长策略导致的社区质量下降。

研究显示,大型语言模型能够根据有限的个人数据(如年龄、性别、教育背景)精准预测个体在调查问卷中的回答模式,其准确度甚至超过传统统计模型。但这本质上是模式匹配,而非真正的“理解”或共情,揭示了 AI 在认知和预测能力之间的关键差距。
![[BUG]: Magic Echo On-Screen Awareness fails with local vision models via llama.cpp](https://www.chat-gpts.plus/wp-content/uploads/2026/07/5984-92d7e1d8-768x403.jpg)
用户在 ThingsLLM Desktop v1.15.0(Windows)中,使用本地 llama.cpp 提供的视觉模型(如 Qwen3-VL、Llama 3.2 Vision 等多模态模型),启用 Magic Echo 并开启 On-Screen Awareness 功能时触发问题。虽然该模型
![[Bug]: PDF document parsing problem](https://www.chat-gpts.plus/wp-content/uploads/2026/07/9719-fd79a576-768x403.jpg)
用户在 RAGFlow 中解析 PDF 文档时触发该错误,使用了“Presentation”切片方法。即使 GPU 显存高达 48G,解析过程仍会失败。系统日志中出现 ONNXRuntimeError 和内存分配失败异常。

用户在使用 llama-server 的 router 模式启动,并通过 pi --resume 恢复之前由编码代理(如 pi agent 0.80.3)填充的长时间会话时触发。问题在 AMD/Vulkan 和 Nvidia/CUDA 架构上均被确认重现。

该问题出现在 llama-server 处理 chat completion 请求时,对话历史包含大量短小的 user/assistant 消息对(例如 140+ 条)。用户显式指定了 batch 大小( -b 2048 -ub 2048 或 -b 4096 -ub 4096 ),但日志显示 pro

用户在 Windows 11 上使用预编译的 llama.cpp Vulkan 或 HIP 版本(llama-b9754-bin-win-vulkan-x64 和 llama-b9754-bin-win-hip-radeon-x64),通过 llama-server 加载模型并启用 --mlock