我对36个流行的MCP服务器进行了Agent可用性评分,三分之一得了D或F。

一位在GitHub上生产环境集成MCP(模型上下文协议)服务器的工程师,开发了一款名为mcpgrade的评分工具,对36个流行MCP服务器进行可用性测试后,发现约三分之一(11个)仅获得D或F级评分。问题不在于协议合规性,而在于工具描述、参数文档和命名等非协议层面的设计缺陷,导致AI Agent会调用错误工具…

我对36个流行的MCP服务器进行了Agent可用性评分,三分之一得了D或F。

一句话看懂:一位在GitHub上生产环境集成MCP(模型上下文协议)服务器的工程师,开发了一款名为mcpgrade的评分工具,对36个流行MCP服务器进行可用性测试后,发现约三分之一(11个)仅获得D或F级评分。问题不在于协议合规性,而在于工具描述、参数文档和命名等非协议层面的设计缺陷,导致AI Agent会调用错误工具、产生幻觉参数甚至完全忽略可用工具。

事件核心:发生了什么

作者Teng Li在Hacker News发布了一份对36个流行MCP服务器的“Agent可用性评分”报告。他用自研工具mcpgrade进行静态扫描,发现大量服务器的可用性远低于预期。排名垫底(D/F级)的包括MongoDB官方服务器(66分,66个错误)、Notion官方(62分)、Airtable(69分,66个错误)、todoist-mcp-server(67分,110个错误)、GitHub的归档参考服务器(67分,44个错误),以及firecrawl-mcp(最低分57分,134个错误)。Stripe和Supabase因无法用假凭据扫描而被排除。评分依据四个维度:描述质量(descriptions)、模式设计(schema)、命名惯例(naming)和Token消耗效率(token)。其中firecrawl的134个错误里,有132个都源于“参数未被描述”。这些参数如urlformatsjsonOptions等只有名称和类型,模型无法得知它们的具体用途、格式或约束。作者进一步通过--eval模式对真实模型(如小型模型)进行实际任务测试,验证了静态评分能精准预测真实调用中的混乱——在低分服务器上,模型拒绝调用工具或填错参数的风险显著增高。

为什么重要

这揭示了一个被行业忽视的关键断层:MCP服务器可以做到100%协议合规,却让AI Agent完全无法使用。当前的行业焦点主要集中在协议层面(JSON-RPC框架、能力协商、模式形状)的合规性检查,但最影响Agent可靠性的恰恰是协议之外的“软约束”——工具描述、参数文档、命名习惯。最讽刺的结果是,Slack的官方MCP服务器(已标注archived,代码无人维护)获得A/97评分,因为该工具被手工精心编写了每个参数描述;而许多积极开发的商业服务器(如MongoDB、Notion、Airtable)却评分极低,原因仅仅是它们的模式定义工具(如zod或OpenAPI)自动生成参数结构时,没有添加.describe(),导致所有参数描述被无声地剥离。这种“合规但不可用”的现状,说明Agent生态的建设者更需关注文档编写纪律,而非仅追求协议对齐。好消息是,作者指出,只要让问题可视化,生态可以快速响应:context7服务器在收到报告后,新版本立刻修复了所有缺失的参数描述,从C级跳升到满分。

对用户/开发者/创作者的影响

开发者:如果你正在构建或集成MCP服务器,最立即可执行的操作是:检查服务器代码中每个参数是否都包含.describe()调用,并补全准确、清晰的用途说明。这是一小时最高杠杆的优化,能直接提升Agent任务的成功率。同时,避免仅依赖自动生成模式的Schema——它们容易丢失关键语义。如果你使用mcpgrade工具(命令行:npx mcpgrade --stdio "npx -y your-mcp-server"),可以无API Key、几秒内获得一份可排序的详细评分报告,精确到每条缺失的描述位于哪个参数。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

普通用户/创作者:当使用依赖MCP服务器的AI应用(如自动邮件处理、数据管理、代码上传等)时,如果遇到Agent频繁出错、不执行指令或莫名其妙跳过工具,问题可能不在于模型能力,而在于底层工具的描述不完整。你可以向工具提供方要求检查其服务器是否经过可用性评分。

AI/Agent产品采购者:在评估第三方MCP插件时,协议合规性不再足以作为选择标准。应当将“工具描述完备性”和“参数文档完整率”作为采购前的关键检查项,以避免集成后出现大量返工。

值得关注的后续

一、mcpgrade工具能否成为MCP服务器开发的标准检查环节?类似Lighthouse之于网页性能,如果大型Agent平台(如OpenAI、Anthropic)将类似的可用性评分纳入插件审核门槛,将推动行业快速补齐文档短板。二、模式生成工具(如zod)是否会通过默认启用.describe()来改善体验?如果不改,开发者社区是否能推出预检查插件。三、部分D/F级服务器(如Stripe、Supabase因凭据限制被排除)未来如果开放测试并修复缺陷,其评分变化可反映商业产品对Agent可用性的重视程度。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 14694

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注