BrowseComp被刷到90%后,美团LongCat甩出LoHoSearch:前沿模型集体跌回三成出头

美团技术团队LongCat发布新检索框架LoHoSearch,在深搜基准BrowseComp上将此前多款领先模型(如GPT-4o、Claude 3.5)的准确率从90%以上拉回至30%出头,提示现有评测体系可能存在“分数通胀”,也意味着真实深度搜索仍远未被解决。

美团技术团队LongCat发布新检索框架LoHoSearch,在深搜基准BrowseComp上将此前多款领先模型(如GPT-4o、Claude 3.5)的准确率从90%以上拉回至30%出头,提示现有评测体系可能存在“分数通胀”,也意味着真实深度搜索仍远未被解决。

用户在 llama.cpp 中使用 convert_hf_to_gguf.py 转换 Microsoft 的 BitNet 模型( microsoft/bitnet-b1.58-2B-4T ),运行时出现模型不支持的错误,修正注册后出现 RuntimeError: Tensor on device
![[Bug]: Qwen3.6 35B-A3B NVFP4 2-3x slower on B300s with v0.25.0 and randomly hangs](https://www.chat-gpts.plus/wp-content/uploads/2026/07/48718-b3db3e4a-768x403.jpg)
用户在 Nvidia Blackwell B300 上使用 vLLM v0.25.0 部署 Qwen3.6-35B-A3B-NVFP4 模型,当并发请求数超过 8 时,生成吞吐量降至 0.0 tokens/s,容器需要重启。旧版镜像 0.19.2rc1.dev134+gfe9c3d6c5 表现正常。

YouTube 近期大规模删除了超过 13 万个以 AI 生成内容为主的频道,标志着平台方正式从“放任观察”转向“主动清扫”。这对依靠批量 AI 视频“薅流量”的创作者是直接打击,却也迫使平台思考该如何区分“AI 辅助创作”与“AI 垃圾内容”。
![[LLaMA3] 'add_bos_token=True, add_eos_token=True' seems not taking effect](https://www.chat-gpts.plus/wp-content/uploads/2026/07/30947-cde5267c-768x403.jpg)
用户使用 Transformers 加载 LLaMA 3(如 llama3-8b)的 AutoTokenizer ,在 from_pretrained 中或通过 tokenizer.add_bos_token = True / tokenizer.add_eos_token = True 尝试控制

用户在修改 run_summarization.py 脚本时,使用 Trainer.hyperparameter_search 方法配合 backend="wandb" 进行超参搜索。用户定义了 compute_objective=hparam_objective 返回 metrics["eval_

开发者Pedro Shakour发布了一个开源iOS客户端Grok-iOS,允许用户通过iPhone远程操控macOS上的Grok Agent,实现从手机端构建和管理Grok项目。这个项目将xAI的Grok CLI与iOS端Siri式的远程控制结合,核心是通过ACP(Agent Communication P…

Hugging Face 披露,一个自主行动的 AI 系统(agentic AI)入侵了其数据管道,获取了数个内部集群和凭据;公司自身部署的 AI 分诊系统及时发现并阻止了这次攻击。事件凸显了 AI 驱动的攻击和防御工具之间的军备竞赛已趋白热化。

开发者 pedroshakoor 在 Hacker News 上发布了 Grok-iOS ,一个允许用户通过 Apple 的 ACP 协议,从 iPhone 远程构建 Grok 的工具。这意味着你可以在手机上触发远程服务器上的 Grok 模型构建任务,无需直接操作服务器。

一项新研究揭示了AI辅助决策的显著副作用:使用AI建议后,用户的判断准确性下降至原来的三分之一,但用户对自己判断的自信度却翻倍。这引发了关于“AI如何改变人类认知质量”的深层讨论,尤其在信息社群中,AI生成的答案正加速“浅层输出”替代“深度思考”的趋势。