NAUTILUS CORE · 组织生产底座

自研 agent harness · 涡轮增压机制

Nautilus 的 agent 工厂:真实任务轨迹采集 harness + 四验门质控 + SFT/RL 自进化 + 基准评测趋势线,四件套闭环运转。本机制是 unipat 判分、数据商品、具身质检三条对外产品线的共同生产底座——产品对外,底座对内,一套机制喂全线。

① 采轨 harness:真实任务,工具调用级

真实任务轨迹采集

轨迹来自真实编码任务执行过程,而非合成脚本回放。每一次工具调用(read/edit/bash/test)逐条落库,粒度到工具调用级,时间戳、参数、返回全留痕。

LocalSandbox 路径 jail:执行环境对文件系统做路径级隔离,agent 只能触达任务工作区,杜绝越权读写污染宿主——采集环境本身即被审计对象。

smoke gate:每条轨迹入库前过冒烟门,环境起不来、依赖装不上、渲染为空的批次当场拒收,不进判读管线。

② 四验门:每条数据的出生证明

G1 render 非空

轨迹渲染非空,禁止一次性全文转储充当轨迹。

G2 held-out 交集=0

改进用样本与评测 held-out 池交集必须为零,改进样本永不入测池——从机制上防数据污染。

G3 环境同构 / qid 唯一

采集环境与评测环境同构,幂等 traj_id 批内+跨批唯一,同题不重采、重采必显形。

G4 实判 / G5 判器锚

每条数据过实判而非格式校验;判器以判据 sha16 预注册锚定,规则只许更严、不许悄悄放宽——判器本身也在被审计。

③ 涡轮增压:SFT+RL 双轮自进化

双轮驱动

四验合格的正样本入 SFT 池,带判因的负样本供 RL 信号;每轮训练出新权重,立刻回评测基准跑分,分数进趋势线。

评测趋势线闭环:不是单点刷分,而是逐轮趋势线——r78→r86 七轮迭代,每轮升降全公开,负结果照报。

判分侧独立复算:训练侧自报分数一律不算数,判分侧(unipat 臂)对每轮权重独立复算,两侧对得上才入账——自我评测与独立判读物理分离。

证据行

165 行轨迹池滚动在库
r78→r86七轮迭代趋势线
四验门G1-G5 逐条过闸
sha16判据预注册锚定

趋势线公开可查:/org/leaderboard.html(基准榜单)· /org/e2e.html(逐单五段验证台,DB 实态驱动)。

本机制是 unipat 判分、数据商品、具身质检三条产品线的生产底座:对外卖的是判读、数据与质检,对内跑的都是同一套采轨→验门→进化→复算管线。同时对外提供 harness 建制咨询——帮你把这套底座长到你自己的组织里。

看懂机制,或用它武装自己

机制细节、验门判据与复算协议全部写在技术白皮书里;想把你的 agent 接入这套管线判一次,从提交收录开始。

技术白皮书 提交收录
Nautilus · 上海国曙人工智能科技有限公司 · 本页为 harness 产品线本地详情页 · 读数以 /org/e2e.html 实时页为准