[Bug]: MinerU parser ignores split page ranges and duplicates chunks
![[Bug]: MinerU parser ignores split page ranges and duplicates chunks](https://www.chat-gpts.plus/wp-content/uploads/2026/07/16586-2c6a0a8a-768x403.jpg)
用户在使用 RAGFlow v0.26.2(commit 62f94cd5)搭配 Docker Compose 部署,配置 MinerU 作为 PDF 解析器(通过 MinerU API 服务)。上传一份超过单次解析页数限制的 32 页 PDF(含多张图片),RAGFlow 自动将文档拆分为多个页范
![[Bug]: MinerU parser ignores split page ranges and duplicates chunks](https://www.chat-gpts.plus/wp-content/uploads/2026/07/16586-2c6a0a8a-768x403.jpg)
用户在使用 RAGFlow v0.26.2(commit 62f94cd5)搭配 Docker Compose 部署,配置 MinerU 作为 PDF 解析器(通过 MinerU API 服务)。上传一份超过单次解析页数限制的 32 页 PDF(含多张图片),RAGFlow 自动将文档拆分为多个页范
![[Bug]: MinerU parser reparses the entire PDF for every page-splitting task, causing duplicate computation and poor performance](https://www.chat-gpts.plus/wp-content/uploads/2026/07/16971-71c00ea7-768x403.jpg)
用户在 RAGFlow (commit cb93883, v0.26.4, Ubuntu 22.04) 中配置 MinerU 解析器,上传一个数百页的大 PDF 文件,启动文档解析任务时触发。

用户通过 llama-server 加载 InternVL3-14B-UD-Q4_K_XL.gguf 及对应的 mmproj-InternVL3-14B-BF16.gguf 视觉项目文件,处理一张含有文字的图片并给出描述。输出结果与原始图片内容严重不符(看不清文字、丢失细节),而在 OpenRout

用户使用 llama-cli 或 llama-server 加载 DeepSeek-V4-Flash(DSV4-Flash)模型,GGUF 格式,MXFP4 量化,5 分片。在设置 --ctx-size 131072 、启用 --flash-attn on 和 MoE expert-offload(

使用 transformers v5 的 AutoTokenizer.from_pretrained() 加载任何 tokenizer_config.json 中设置了 "tokenizer_class": "LlamaTokenizerFast" 或 "LlamaTokenizer" 的模型。已确

用户在一台仅配备 AMD iGPU(Radeon 890M,RDNA 3.5 架构)的 Linux 设备上运行 Ollama(版本 0.5.11),并与 llama.cpp 的 CPU、ROCm 后端进行性能对比。测试发现 Ollama 推理速度显著慢于 llama.cpp 的 ROCm 后端,甚至

HackerNews 上讨论指出,LLM 用于配置 MikroTik 的 RouterOS 时,由于系统本身的“高瘦”配置语言特性,AI 幻觉主要限于语法错误,而非概念性误解。同时,思科旗下 Meraki 已推出 AI 助手功能,网络设备配置正成为 LLM 落地的真实应用场景。

开发者 Greg 分享了过去几个月使用 LLM(如 Claude)配置 MikroTik 网络设备的真实经验,证明 LLM 在复杂网络配置场景中能显著提升效率,但也指出需要保持谨慎和验证。这一实践揭示了 LLM 正在从编码扩展至网络运维领域,对网络工程师、设备商和 AI 应用开发者均具参考价值。

Thoughtworks 杰出工程师 Unmesh Joshi 在 Martin Fowler 博客发文论证,领域特定语言(DSL)可以约束 LLM 的输出范围,弥补大模型在“前期规格说明”与“通过实现发现设计”两大核心局限,从而让 LLM 从不可控的代码生成器变为可靠的设计与实现工具。该文提出 DSL 应成…
![[Bug]: I encountered an error that prevented successful document parsing: Function 'batch_encode' timed out after 5 seconds and 2 attempts.](https://www.chat-gpts.plus/wp-content/uploads/2026/07/9448-25f1db81-768x403.jpg)
用户从 RAGFlow v0.19.0 升级到 v0.20.1 后,在新建知识库中解析包含 DDL 描述的 .md 文档(使用 DeepDoc PDF parser、BAAI/bge-large-zh-v1.5 embedding 模型、通用切片方法)时触发。解析过程中,文档已完成关键词与问题生成,