企业年报文本情感分析系统
从“分析年报中指定关键词相关语句的情感态度”出发,完成文本处理、关键词句筛选、情感分类、倾向汇总、结果校验与 GUI 操作流程;先交付单企业版本,再根据实际使用扩展多企业批量处理,并迭代 XLSX 输出。
AGENT EVALUATION EVIDENCE PACK
面向 Agent 评测与质量场景的定向证据包:以复合任务为单元,记录执行路径、检查项、产物状态与失败标签,并将结果转化为模型、规则与人工协作的质量判断。
01 / AGENT EVALUATION
外部委托 / 众包模型评测中,我在两类 Agent / 执行架构下执行复合任务,按任务理解、工具调用、执行过程、产物状态与结论证据记录表现。重点不是给出笼统好坏,而是将异常归入可继续定位的质量信号。
02 / QUALITY WORKFLOW
Text2SQL Agent 是本地原型;它呈现的是我如何把生成、校验、审批、重试和审计拆成明确状态,让高风险动作具有检查点和可追溯过程,而不是把一次回答当成任务完成。
03 / DELIVERY
企业年报文本情感分析系统为真实付费外部委托。它不是 Agent 评测项目,但能证明我能把模糊需求、系统约束、结果校验和可验收交付放入同一条链路。
从“分析年报中指定关键词相关语句的情感态度”出发,完成文本处理、关键词句筛选、情感分类、倾向汇总、结果校验与 GUI 操作流程;先交付单企业版本,再根据实际使用扩展多企业批量处理,并迭代 XLSX 输出。
04 / EVALUATION FRAMEWORK
Skill Lens 是我设计的 AI Agent / Skill 审计与 Badcase 评估框架。它把评测从单次结果判断,延展为可定位、可复盘、可形成下一轮测试输入的系统分析。
以 Source Pack 为输入,通过系统结构、关键决策、失败路径、Prompt / 接口、责任边界五个透镜审计 Agent;面对 Badcase 时,进一步检查任务完成、工具调用与状态、失败恢复、成本与安全、迭代指标。每项重要结论均回到具体证据坐标,避免由单次输出直接推断系统质量。
05 / GAME QUALITY
《今天先把气撒了》是 30 秒单局的微信小程序解压游戏。我从零完成 GDD、数值调优体系与 AI 辅助审查流程,并以评分推演和参数复核推动版本迭代。
以“爽感触觉、爽感速度、情绪差异化、零羞辱、留存”为五条设计支柱,完成粉碎、连击、物体生成、寿命警告、倒计时、评分和新手引导等七个机制规格。重设评分时,删除会奖励“快速清场后等待”的剩余秒数项,改用连击倍率激励持续操作。建立 20+ 个可调参数及其假设、触发条件与 Min / Max 范围;将所有数值作为待真实 Playtest 验证的假设,而非预设结论。Playtest 前预先定义“难度坏了”的观察阈值,令参数调整具备明确的失败判定。