只要智能体输出符合约定的遥测轨迹,同一套评测器就能覆盖 LangGraph、LlamaIndex 等多种框架。

智能体框架越多,评测系统越容易碎片化。AWS 于 2026 年 8 月 26 日介绍了 Amazon Bedrock AgentCore Evaluations 的跨框架机制:评测不再依赖某个专用开发套件,而是读取标准化的运行轨迹。
同一套评分覆盖多种框架
目前文档列出的直接支持对象包括 Strands Agents、LangGraph、OpenAI Agents SDK、LlamaIndex、Google ADK 和 Claude Agent SDK。只要对应的遥测库按 OpenTelemetry 生成式 AI 语义约定或 OpenInference 规范输出数据,服务就能识别推理、工具调用和代理执行等轨迹。

对于没有列入名称的框架,符合约定的 instrumentation 作用域也可走通用读取路径。换句话说,接入合同从“你用了哪个框架”变成“你是否输出了结构正确的遥测”。
评测前先重建真实会话
AgentCore Evaluations 会从 CloudWatch 读取跨度与事件记录,以 session.id 汇总会话,再按 trace_id 划分每一轮交互。重建后,同一组目标完成率、正确性、有用性和自定义大模型裁判可以统一评分。
这对同时使用多个框架的团队很重要:指标名称和评分流程保持一致,迁移框架时不必重新建设一整套评测基础设施,也更容易做横向对比。
标准化不等于零配置
AWS 的示例提醒,轨迹仍需完整、及时地送达。运行环境结束前若没有刷新遥测缓冲区,部分数据可能留在客户端;会话标识不一致、缺少顶层执行跨度,也会让服务无法正确重建任务。
团队还要决定什么才算“好”。通用评测器适合衡量正确性和有用性,但金融、医疗、客服等业务往往需要自定义规则、参考答案和代码评测器。框架无关只解决数据接入一致性,不会自动定义业务质量。
怎样落地
先选一批包含成功、失败和边缘情况的历史会话,确认遥测字段完整,再让不同框架使用相同评测器跑一遍。随后把评分接入持续集成和线上抽样监控,观察提示词、模型或工具变更是否造成回归。
YouCanStudy.AI 的判断
这项更新的价值在于把智能体评测从框架插件变成遥测协议问题。它降低了多框架团队的接入成本,但真正可靠的质量体系仍需要稳定数据、业务基准、重复运行与人工复核共同组成。