RSI‑Exam 🧵:一套覆盖6大领域、包含88项可落地研究任务的评测集,现已开放各领域的任务共建通道🧑🔬。
任务库覆盖虚拟细胞、TPU内核、芯片设计、量化金融、智能体框架、模型蒸馏等方向。
所有任务的每一轮rollout都统一遵循这套核心协议:
🔁 智能体拿到一套可用基线方案,基于可见数据集开展迭代优化;
🔒 仅最终输出产物会被放入全新环境,在隐藏测试集上完成评测;
📊 当前榜单结果:Opus 5以平均分0.464位居88项任务总榜首位
[种草R]RSI‑Exam 中每一项任务都是一套可执行的研究环境,包含:
📦 一套可正常运行的初始成果
📏 任务专属评价指标
👀 用于迭代研究的可见数据集
🔒 用于最终评测的隐藏数据集
⏱️ 固定的研究资源预算
[种草R]RSI‑Exam 所有候选任务都需要历经四个阶段:
1️⃣ 问题遴选:该问题必须具备可运行的基线方案、可量化的优化目标、充足的提升空间,以及用于评测的私有数据集。
2️⃣ 环境搭建:将任务封装两套环境,一套供智能体开发使用,另一套为核验器专用的密封隔离环境。
3️⃣ 分数校准:使用同一套核验器重新运行各类参考方案,随后固化聚合规则、参考基准与分数映射关系。
4️⃣ 全流程评审:由第二位专家对任务进行复核,之后开展长周期试点测试,重点校验:
🔍 具备合理的性能提升空间
🧩 拥有真实的实际难度
🔒 可见集到隐藏集的泛化迁移能力
⏱️ 具备足够深度,可支撑持续研究
试点智能体就能轻松完成的任务会直接剔除;需要修改的任务,会附带完整运行轨迹退回给任务作者
[种草R]十小时自主研究的真实过程是什么样?
以「科学发现智能体框架设计」任务为例:GPT‑5.6‑sol 接手了一套无状态、单次调用的 ReAct 基础框架。
在历时10.5小时的完整迭代过程中,它完成了以下工作:
🧠 搭建了带状态记忆与证据留存机制的框架
⚙️ 在可行的位置,用确定性控制器替代模型自主决策
🧪 增设对照实验组与全新观测指标
🧹 回滚所有无法带来收益的改动
它在可见测试集上的平均分从 0.10 提升至 0.63,本次迭代运行成本约 160 美元。
将最终产出放到隐藏集重新评测后,得分为 0.256,换算归一化分数为 0.45。
保存下的各个版本,不光能看到分数是否上涨,还可以回溯整个过程中研究策略是如何演变的
#深度学习 #AI搞学习howto #评测集 #评测集构建 #RSI #自进化








