Nautilus 的 agent 工厂:真实任务轨迹采集 harness + 四验门质控 + SFT/RL 自进化 + 基准评测趋势线,四件套闭环运转。本机制是 unipat 判分、数据商品、具身质检三条对外产品线的共同生产底座——产品对外,底座对内,一套机制喂全线。
轨迹来自真实编码任务执行过程,而非合成脚本回放。每一次工具调用(read/edit/bash/test)逐条落库,粒度到工具调用级,时间戳、参数、返回全留痕。
LocalSandbox 路径 jail:执行环境对文件系统做路径级隔离,agent 只能触达任务工作区,杜绝越权读写污染宿主——采集环境本身即被审计对象。
smoke gate:每条轨迹入库前过冒烟门,环境起不来、依赖装不上、渲染为空的批次当场拒收,不进判读管线。
轨迹渲染非空,禁止一次性全文转储充当轨迹。
改进用样本与评测 held-out 池交集必须为零,改进样本永不入测池——从机制上防数据污染。
采集环境与评测环境同构,幂等 traj_id 批内+跨批唯一,同题不重采、重采必显形。
每条数据过实判而非格式校验;判器以判据 sha16 预注册锚定,规则只许更严、不许悄悄放宽——判器本身也在被审计。
四验合格的正样本入 SFT 池,带判因的负样本供 RL 信号;每轮训练出新权重,立刻回评测基准跑分,分数进趋势线。
评测趋势线闭环:不是单点刷分,而是逐轮趋势线——r78→r86 七轮迭代,每轮升降全公开,负结果照报。
判分侧独立复算:训练侧自报分数一律不算数,判分侧(unipat 臂)对每轮权重独立复算,两侧对得上才入账——自我评测与独立判读物理分离。
趋势线公开可查:/org/leaderboard.html(基准榜单)· /org/e2e.html(逐单五段验证台,DB 实态驱动)。