AI模型性能评测和基准测试
共找到 8 个工具
LangSmith 是由 LangChain 团队打造的 LLM 应用全生命周期开发平台,提供追踪、评测与提示词优化功能,助力开发者高效调试和监控大模型应用。
Scale Spellbook 是一款专为大语言模型应用设计的评测与优化平台,提供标准化评测框架与可视化分析,帮助团队量化模型效果并加速提示词迭代。
PromptFoo 是一款开源的大语言模型应用评测框架,通过自动化测试与多维度指标量化,帮助开发者高效评估提示词效果与模型表现。
Helicone 是一款专为大语言模型应用设计的开源可观测性平台,提供实时监控、成本分析与延迟追踪,助力开发者优化 AI 产品性能与预算。
LangFuse 是一款专为大型语言模型应用设计的开源可观测性平台,提供全链路追踪、成本监控与 Prompt 管理,帮助团队高效调试和优化 AI 应用性能。
LLM网关和监控
AI产品评估
LLM评测平台
浏览更多 AI 工具分类,发现适合你的工具