AI产品库
Braintrust Logo

LLM 可观测与评测

Braintrust

智能体的可观测、评测与回归平台

官方把它定义为「面向智能体的主动可观测平台」:把追踪、评测与行为发现放在同一处,用生产流量驱动的评测与自动发现的模式定位问题,并强调要在发布前拦住质量回退。

深度介绍

Braintrust详细介绍

🛰

定位:把「观测」做成主动的

官网的自我描述是「面向智能体的主动可观测平台」。这里的「主动」是相对传统监控而言:普通软件出错会有异常堆栈,而智能体失败往往只是回答变差、工具调错或语气跑偏,不会触发任何报错。Braintrust 的思路是不等用户投诉,而是把线上每一步都记录下来,再由系统主动分析出值得注意的行为模式,反馈到评测与改进流程中。官方把它归纳为三根支柱:Observe(观测)、Evaluate(评测)、Discover(发现)。

🔎

观测:把每一步提示词与工具调用都摊开

观测侧的能力包括:实时查看提示词、回答与工具调用;在数以百万计的日志中检索;持续跟踪延迟、成本与质量三个维度;支持较大规模的追踪数据写入,并提供自定义视图与标注。文档的对应章节还覆盖用户反馈收集与附件(例如把截图或文件附在追踪记录上)。对排查「为什么这次回答不对」这类问题,能看到完整调用链与中间结果,通常比只看最终输出有用得多。

🧪

评测:用真实数据比较提示词与模型

评测侧支持对真实数据集运行实验、并排比较不同提示词与模型,并可用三种方式给输出打分:模型打分、代码打分与人工打分。官方强调数据集是版本化的,配合游乐场可以快速试改提示词;此外还有在线打分(对生产流量实时评分)、远端评测与实验管理。实际的用法通常是:从线上挑出有代表性的样本做成数据集,改动提示词或模型后跑一轮对比,只有指标不降才允许发布,从而把主观判断换成可回归的检查。

🧭

发现:用自然语言调查线上行为

第三根支柱是发现能力:用自然语言对追踪数据做调查、给出有证据支撑的模式发现、在规模上做主题分类并识别失败类型,配套还有自定义图表与告警。它解决的问题是「数据太多、不知道该看什么」——人工翻日志只能覆盖很小的样本,而自动聚类与分类可以把高频问题排到前面。对已经积累了大量线上流量的团队,这一步往往能发现此前没意识到的系统性缺陷。

🚪

部署与网关:把提示词与函数也管起来

除观测与评测,文档还设有部署章节,包含提示词管理、函数部署、模型网关、环境管理、监控与流式输出等能力。也就是说它不只做「看」和「评」,还承接「发布」:提示词可以变成可版本化的资产,模型调用可以经由网关统一路由与计量,环境之间可以区分开发与生产。对已经用多个模型供应商的团队,网关加审计的组合有助于把调用口径收拢到一处。

🏷

人工标注与数据管理

标注侧提供人工评审、自定义视图、标签与纠正,以及数据集与导出功能;在计费上,人工评审评分的额度按档位区分——免费档每个项目可配置 1 个,Pro 档不限。数据管理方面,企业版支持自定义留存与导出策略,并有访问控制与审计日志。对需要把线上案例沉淀为长期资产(而不是每次重新标注)的团队,数据集与导出链路是否顺畅,往往比界面好不好看更关键。

💳

计费结构:平台费加四类用量

价格页把费用拆成平台费与四类用量:模型额度(用于内置 AI 功能与内置模型调用)、处理过的数据量、打分次数与数据留存期。免费档为 0 美元,含每月 10 美元模型额度、1 GB 数据处理(超出每 GB 4 美元)、1 万次打分(超出每千次 2.5 美元)与 14 天留存,且不限用户数、项目数、数据集与实验数量;Pro 档每月 249 美元,含 100 美元额度、5 GB 数据处理(超出每 GB 3 美元)、5 万次打分(超出每千次 1.5 美元)与 30 天留存,并增加自定义图表、环境、优先级支持与基于角色的访问控制。

🏢

企业版与开源:两条补充路径

企业版按需报价,提供自定义留存与导出、基于角色的访问控制与高级支持,并可选托管或本地部署,适合数据敏感或用量较大的团队;官方另为符合条件的创业公司提供 6 至 12 个月免费。开源方面,团队维护着评测库 autoevals:它把多种自动评测方法打包在一起,包括模型评审、启发式方法(如编辑距离)与统计指标(如 BLEU),提供 Python 与 TypeScript 两种安装方式,也可自定义评审提示词。不想被平台绑定太重时,可以先从这个库入手。

产品特点

核心功能与独有价值

01

观测、评测与发现三件套同平台

线上追踪、数据集评测与自动行为发现放在同一处,避免在监控工具、评测脚本与标注表格之间来回搬运数据,也便于把线上问题直接转成回归用例。

02

三种打分方式并存

输出可用模型、代码或人工三种方式评分,并支持对生产流量做在线打分;数据集带版本管理,便于比较改动前后的效果并作为发布门禁。

03

不仅观测,还能发布

部署侧提供提示词管理、函数部署、模型网关、环境、监控与流式输出等能力,把「看数据」与「改配置、发上线」串在同一条链路上。

04

开源评测库 autoevals

团队开源的评测库打包了模型评审、启发式与统计指标等多类自动评测方法,提供 Python 与 TypeScript 版本,可单独使用而不必接入平台。

最近动态

重要更新

计费结构(价格页核验时点)

价格页当前把费用拆为平台费、模型额度、处理数据量、打分次数与留存期:免费档 0 美元含每月 10 美元模型额度、1 GB 处理数据与 1 万次打分(14 天留存),Pro 档每月 249 美元含 100 美元额度、5 GB 与 5 万次打分(30 天留存),企业版按需报价。

文档结构反映的三支柱(核验时点)

官方文档按 Start、Instrument、Observe、Annotate、Evaluate、Deploy、Admin 与最佳实践组织,覆盖追踪、用户反馈、日志与模式、主题、仪表盘与告警、人工评审与数据集、提示词与评测器、游乐场与实验、在线打分、模型网关与环境、审计日志与访问控制等板块。

开源评测库 autoevals(核验时点)

官方开源库 autoevals 面向模型输出评测,内置模型评审、启发式(如编辑距离)与统计指标(如 BLEU)等自动评测方法,提供 Python(pip)与 TypeScript(npm)安装方式,并支持自定义评审提示词与异常处理。

创业扶持与企业部署(核验时点)

官网设有面向创业公司的扶持计划,符合条件的团队可获 6 至 12 个月免费;企业版提供自定义数据留存与导出、基于角色的访问控制与高级支持,并可选本地部署或托管部署,适合数据敏感或高用量场景。

产品总结

Braintrust 是一个面向 AI 智能体的可观测与评测平台,官网把它称为「面向智能体的主动可观测平台」。这里的「主动」针对的是智能体特有的失败方式:普通软件出错会抛出异常,而智能体往往只是回答变差或调错工具,不会触发告警。平台因此把线上每一步记录下来,并主动分析值得注意的行为模式,归纳为三根支柱:Observe(观测)、Evaluate(评测)与 Discover(发现)。 观测侧可以实时查看提示词、回答与工具调用,在数以百万计的日志中检索,并持续跟踪延迟、成本与质量,支持自定义视图、标注、用户反馈与附件。评测侧支持对真实数据集运行实验、并排比较提示词与模型,并可用模型、代码或人工三种方式打分;数据集带版本管理,配套游乐场、在线打分与远端评测,典型用法是把线上问题做成数据集后作为发布门禁。发现侧则提供自然语言调查、有证据支撑的模式发现、规模化的主题分类与失败识别,并有自定义图表与告警。此外,文档还设有部署章节,包含提示词管理、函数部署、模型网关、环境管理、监控与流式输出,把「看数据」与「发上线」串在一条链路上。 计费把费用拆成平台费与四类用量:免费档为 0 美元,含每月 10 美元模型额度、1 GB 处理数据(超出每 GB 4 美元)、1 万次打分(超出每千次 2.5 美元)与 14 天留存,且不限用户、项目、数据集与实验数量;Pro 档每月 249 美元,含 100 美元额度、5 GB 处理数据(超出每 GB 3 美元)、5 万次打分(超出每千次 1.5 美元)与 30 天留存,并增加自定义图表、环境、优先级支持与基于角色的访问控制。企业版按需报价,提供自定义留存与导出、访问控制与高级支持,可选托管或本地部署;官方另为符合条件的创业公司提供 6 至 12 个月免费。 生态方面,团队维护开源评测库 autoevals,把模型评审、启发式方法与统计指标等自动评测打包在一起,提供 Python 与 TypeScript 版本,可独立于平台使用。选型时建议注意三点:一是用量计价项较多(模型额度、处理数据、打分次数、留存),估算成本时要按自己的实际流量换算;二是人工评审评分额度在免费档有限制,标注量大的团队需评估档位;三是数据留存期与部署形态直接关系到合规,涉及敏感数据时应优先确认企业版选项。

产品类型
LLM 可观测与评测
支持平台
网页控制台 / 官方 SDK 与集成 / 模型网关(Braintrust Gateway) / 在线打分与远端评测 / 自托管或托管部署(企业版) / 开源评测库 autoevals
资费模式
免费档含 10 美元模型额度、1 GB 数据处理与 1 万次打分;Pro 每月 249 美元含 100 美元额度、5 GB 与 5 万次打分;企业版按需报价。

核验信息

参考文章与数据来源

本页事实来自 Braintrust 官方渠道:官网首页(面向智能体的主动可观测定位、三根支柱与工作流说明、团队协作口径)、官方文档目录(追踪与用户反馈、日志与模式、主题与仪表盘、人工评审与数据集、提示词与评测器、游乐场与实验、在线打分、提示词与函数部署、模型网关与环境、审计日志与访问控制等板块)、价格页(免费档、Pro 档与企业版的平台费、模型额度、处理数据量、打分次数与留存期,以及人工评审评分额度差异)、创业扶持页面,以及官方开源组织与其评测库 autoevals 的仓库说明。价格与功能核验于 2026 年 9 月 22 日,请以官方当期说明为准。

  1. 官网Braintrust 官网
  2. 官方文档官方文档
  3. 其他官方价格与方案
  4. 其他开源评测库 autoevals
  5. 其他官方开源组织
  6. 其他客户案例
  7. 其他创业扶持计划
  8. 其他官方博客

用户体验调查

Braintrust介绍页面对您是否有帮助?