← Agent 评测基础设施
全部项目
技术阅读库 · ByteTech
Agent 评测基础设施 · 评测阅读库
围绕 Agent 评测方法论、Agent-as-Judge / LLM-as-Judge 判分、Rubric 可信校准、评测集自动化构建与 Coding Agent 基准整理。
需 ByteTech 权限访问
Agent Evaluation
说明:本页仅做外部链接索引与一句话摘要,不转载 ByteTech 全文内容。
Agent 评测方法论 · 标准
LLM Agent 评测标准(联合发布)
公司级 Agent 评测标准,覆盖能力维度、轨迹、工具调用与评测框架。
Agent 评测方法论梳理
梳理 Agent 与静态问答基准的差异,解释为什么必须真实跑题与收集轨迹。
2025 年了,AI Agent 如何评测?
Agent 评测现状与前沿实践总览,支撑“评测基础设施”项目背景。
Agent-as-Judge · Rubric 判分
从生成到评估 —— 用 Rubrics + LLM-as-a-Judge 让 AI 变得可靠
Rubric + 裁判模型多维加权打分,对应项目中的 rubric 阈值判定与稳定性校准。
Agent-as-a-Judge: Evaluate Agents with Agents
把判题建模为自包含 Agent 运行,是 Agent-as-Judge 判分设计的理论来源。
我们评估 LLM-as-a-Judge 的方式,走对了吗?
讨论裁判模型偏差与可信度,连接 Cohen's kappa / bootstrap 这类一致性度量。
评测集自动化构建 · 出题校准 · Coding 基准
Coding Agent 端到端评测集自动化构建方案
从仓库 commit 挖掘到用例校验代码生成、流水线验证可用性,对应自动化出题 + 校准产线。
评测集仿真与分层评测体系建设与实践
评测集仿真与难度分层实践,对应“过滤过易/过难题,只留有区分度样本”。
SWE-Bench Pro:长周期软件工程任务中的 AI Agent 评测
长周期 SWE 任务评测基准,强调真实研发场景下的可解性与可验证性。
Agent 轨迹评测与分析
围绕调用轨迹做评测和复盘,对应项目中的轨迹采集与逐 step 判分。
← 返回项目详情