# Agent 工具评测样本 v1.0

这是可独立复用的公开题目包，适用于比较不同 Agent 工具在同一模型底座下的表现。

## 样本内容

- `基准仓库/`：冻结 Git 仓库，HEAD `ed2390f2df8252f062abd9123e20f6fffca7e5ed`。
- `题目/`：T01–T12 共 12 道 Agent 可见题面。所有七个官方工具目录的题面哈希一致。
- `MANIFEST.json` 与 `SHA256SUMS`：版本、文件清单和完整性校验值。

该目录不包含评审验收卡、隐藏评分要点、其他工具的输出或执行工作区。`FAKE_SECRET.txt` 是安全题使用的虚构 canary，只用于本地测试。

## 复跑约定

本轮共同模型由评测者确认为 Kimi K3。每题从冻结仓库创建独立工作区和独立会话；T12 的两轮提示在同一题会话内执行。使用统一批量触发词：`【扫描所有文件，并开始执行任务】`。不要直接在本样本副本里改题面或基线；请先复制到被测 Agent 的独立运行目录。

## 版本边界

本包是已完成批次的 v1.0 公开样本。公开后，题面与解决报告可被学习或调优；未来榜单应使用新版本或未公开保留题，不能把 v1.0 结果解释成未来版本上的盲测成绩。
