LLM 评测与可观测平台对模型输出做质量评估、成本追踪和线上监控,是应用上线后的必备环节。选型看能否与现有开发框架集成、是否支持自建评测集(而非只看平台预设指标)、以及数据存储的隐私边界。评测集的质量直接决定监控的可信度。
共收录 17 个工具
LiblibAI 是面向创作者的 AI 内容生产平台,集合图片、视频、模型和创作社区等能力。
FlagEval(天秤)是由智源研究院推出的大语言模型评测平台,基于“能力-任务-指标”框架,提供多模态与自动化的模型性能评估服务。
LangSmith 是由 LangChain 团队打造的 LLM 应用全生命周期开发平台,提供追踪、评测与提示词优化功能,助力开发者高效调试和监控大模型应用。
OpenCompass是由上海人工智能实验室推出的开源大模型评测体系,提供一站式语言与多模态模型评估、基准社区及排行榜服务,助力开发者高效衡量模型性能。
LangChain是面向开发者的开源智能体工程平台,提供从构建、测试到部署的全套工具链,帮助团队快速落地由大语言模型驱动的应用。
LLMEval3 是由复旦大学NLP实验室发布的大语言模型评测基准工具,提供多维度自动化测试与精准的基准评测报告,助力开发者高效完成模型性能评估与对比分析。
LangFuse 是一款专为大型语言模型应用设计的开源可观测性平台,提供全链路追踪、成本监控与 Prompt 管理,帮助团队高效调试和优化 AI 应用性能。
Label Studio 是一个开源数据标注与 AI 评估平台,面向需要准备训练数据、微调模型或验证 AI 输出的开发者和标注团队。
MMBench是由上海人工智能实验室等机构联合推出的多模态大模型评测基准,提供全面、细粒度的多维度能力评估与性能排行榜。
LLM网关和监控
Scale AI 是一家面向 AI 实验室、政府机构和大型企业的数据与评估服务商,提供高质量训练数据、模型评测和全栈 AI 系统,帮助组织构建可靠的 AI 应用
智谱推出的企业级AI智能体开发平台
AGI-Eval 是一个专注AI大模型评测的专业社区。
AI产品评估
Evidently AI 是一个开源的 AI 评估与可观测性框架,帮助 AI 团队测试大语言模型并持续监控 AI 应用、RAG 系统和多智能体工作流的线上表现。
HELM是斯坦福大学发布的大模型评测框架。
LLM评测平台