丁歆懿 Ding Xinyi Megan / AI AGENT EVALUATION 18302022887|593167398@qq.com

AGENT EVALUATION EVIDENCE PACK

Agent 全链路评测
从任务执行到
失败归因。

面向 Agent 评测与质量场景的定向证据包:以复合任务为单元,记录执行路径、检查项、产物状态与失败标签,并将结果转化为模型、规则与人工协作的质量判断。

5 个代号模型3 类复合任务任务检查项失败标签归纳小游戏 GDD / 数值验证

01 / AGENT EVALUATION

围绕任务完成路径,记录可复核的质量检查项。

外部委托 / 众包模型评测中,我在两类 Agent / 执行架构下执行复合任务,按任务理解、工具调用、执行过程、产物状态与结论证据记录表现。重点不是给出笼统好坏,而是将异常归入可继续定位的质量信号。

评测范围
基于 OpenClaw 与 Hermes 两类 Agent / 执行架构,对 5 个代号模型执行 3 类复合任务。
任务检查项
任务理解、工具调用、代码执行、数据处理、文件读写、产物保存与结果稳定性。
记录单元
以单次任务的执行路径、可观察产物与异常结果为单位,保留过程证据。
诊断输出
将异常映射到模型生成、确定性校验、人工审批或异常回退等责任层,作为后续质量复盘输入。

可用于质量复盘的失败标签

  • 上下文丢失或任务目标漂移
  • 工具链路中断、调用不符合前置条件
  • 产物格式不一致或保存位置错误
  • 结论与数据证据不一致

02 / QUALITY WORKFLOW

用规则、审批与重试控制 Agent 任务的质量风险。

Text2SQL Agent 是本地原型;它呈现的是我如何把生成、校验、审批、重试和审计拆成明确状态,让高风险动作具有检查点和可追溯过程,而不是把一次回答当成任务完成。

意图解析理解任务与约束
Schema 检索补足结构化上下文
SQL 生成模型给出候选
预校验EXPLAIN 确定性校验
人工审批高风险动作确认
执行记录可追溯结果
失败重试带错误上下文,最多 3 次
审计日志记录查询、SQL 与异常

03 / DELIVERY

质量不止是任务完成,也包括用户能否独立得到可验收结果。

企业年报文本情感分析系统为真实付费外部委托。它不是 Agent 评测项目,但能证明我能把模糊需求、系统约束、结果校验和可验收交付放入同一条链路。

企业年报文本情感分析系统

从“分析年报中指定关键词相关语句的情感态度”出发,完成文本处理、关键词句筛选、情感分类、倾向汇总、结果校验与 GUI 操作流程;先交付单企业版本,再根据实际使用扩展多企业批量处理,并迭代 XLSX 输出。

04 / EVALUATION FRAMEWORK

将一次 Agent 审计拆为可复核的结构、失败路径与责任边界。

Skill Lens 是我设计的 AI Agent / Skill 审计与 Badcase 评估框架。它把评测从单次结果判断,延展为可定位、可复盘、可形成下一轮测试输入的系统分析。

Skill Lens|AI Agent 与 Skill 审计框架

以 Source Pack 为输入,通过系统结构、关键决策、失败路径、Prompt / 接口、责任边界五个透镜审计 Agent;面对 Badcase 时,进一步检查任务完成、工具调用与状态、失败恢复、成本与安全、迭代指标。每项重要结论均回到具体证据坐标,避免由单次输出直接推断系统质量。

05 / GAME QUALITY

把小游戏机制、数值假设与质量复核放进同一条设计闭环。

《今天先把气撒了》是 30 秒单局的微信小程序解压游戏。我从零完成 GDD、数值调优体系与 AI 辅助审查流程,并以评分推演和参数复核推动版本迭代。

《今天先把气撒了》|微信小游戏 GDD 与质量设计

以“爽感触觉、爽感速度、情绪差异化、零羞辱、留存”为五条设计支柱,完成粉碎、连击、物体生成、寿命警告、倒计时、评分和新手引导等七个机制规格。重设评分时,删除会奖励“快速清场后等待”的剩余秒数项,改用连击倍率激励持续操作。建立 20+ 个可调参数及其假设、触发条件与 Min / Max 范围;将所有数值作为待真实 Playtest 验证的假设,而非预设结论。Playtest 前预先定义“难度坏了”的观察阈值,令参数调整具备明确的失败判定。