部署链路里只有 NN:单次前向输出整条 80 步轨迹,运行时零 IPOPT、零搜索器。IPOPT 退居幕后当教师(数据生产 / DAgger 重解标注),最终交卷的每一步都是网络自己输出的。
| 关键结论 | 证据 |
|---|---|
| "单次前向→厘米级"无先例;单次前向极限约 0.2-0.4m | 扩散规划 / RL / 工业界(Tesla/Waymo/NVIDIA)三方独立确认;MultiPark 证实泊车单模态回归天花板 |
| 精度是超指数问题:log N ∝ 1/(P−c),堆数据不经济,必须换方法下推极限 c | Curse of Precision (arXiv:2607.23108) |
| BC 复利误差 O(Hε) → DAgger 压到常数级;专家是求解器 = 全自动自举 | DAgger (Ross et al. 2011) / HG-DAgger / ExIt |
| "BC 米级 → RL/自举后分米级"路线成立,前提条件我们全部满足(已知模型/可验证reward/完美观测) | Swift (Nature 2023) / Song 2023 (RL胜最优控制专家) / REAP 2026 (实车窄位泊车) |
| 已知可微动力学直接进训练损失 = 样本效率最高的闭环化训练 | DPC / Differentiable MPC / DiffOG |
完整报告:v414_research/00_综合报告.md + track1/2/3 三份分报告(学习型轨迹优化 / DAgger·RL / scaling·测试时计算)。
| 误差来源 | 现状占比(估) | 对策 | 砍完剩余 |
|---|---|---|---|
| 分布偏移复利(NN 走到的状态没见过标签) | ~50% (≈1m) | 支柱①DAgger 自举(IPOPT 全自动教师 + 网络轨迹热启动,3-5 轮) | ~0.15m |
| 动力学不自洽(回归轨迹物理上跑不出来) | ~25% | 支柱②物理一致性训练(可微 rollout 残差进 loss,训练即闭环) | ~0.05m |
| 同伦类边界回归平均(单模态天花板) | ~15% | 支柱③同伦 MoE(按泊车机动类分专家,边界错路由路由器承担) | ~0.05m |
| 坐标系/表示损失(终端误差不是显式函数) | ~10% | 支柱④goal-frame 表示 + Sobolev 灵敏度蒸馏 | ~0.03m |
| # | 模块 | 做什么 | 依据 |
|---|---|---|---|
| ① | DAgger 数据飞轮 | 当前网络闭环 rollout → 在网络到达的偏差状态上 IPOPT 热启动重解("专家纠正")→ 混训迭代 3-5 轮;失败工况进高优先 buffer(纠正经验思想)。每轮 3 万状态 | DAgger O(Hε)→常数;HG-DAgger 保留失败态;ParkingWorld 纠正经验;iCOIL 同构反例(裸 IL 停在分米级) |
| ② | 物理一致性训练 | NN 输出 U → RK4 可微 rollout(torch)→ 损失 = 终端位姿误差 + OBB 碰撞 hinge(可微化)+ 铰接角约束 + 控制平滑,联合反传;输出头构造式限幅(tanh×δmax/vmax) | DPC 离线版 / Differentiable MPC / RAYEN·ShardNet 构造式约束层 |
| ③ | 同伦 MoE | 泊车机动同伦类标签(换向次数/路径族)→ MoE 按类分专家,破解单模态回归平均;同伦链数据天然带类标签 | MultiPark(泊车多模态实证)/ MPC-Net / MoE-DP |
| ④ | goal-frame + Sobolev 蒸馏 | 全部输入输出换到目标位姿坐标系(终端误差成为显式输入,等变≈免费数据×N);蒸馏 IPOPT KKT 灵敏度 ∂x*/∂p(同伦链相邻样本=现成灵敏度方向) | 等变实用三档 (2505.13431) / CACTO-SL / Sobolev diffusion policies (2604.19011, 加速2-20×) |
| 牌 | 内容 | 触发条件 |
|---|---|---|
| 多候选+择优 | 策略头输出 K=16-32 条候选 → 解析可微评分(终端误差+障碍距离+平滑)→ argmax,GPU 上 <10ms,零求解器 | P3 后 med 仍 >0.35m(Hydra-MDP 冠军打法,技术顺路) |
| RL 后训练 | GRPO 组相对优势(免 critic),可微仿真器内组采样 G=8-16,reward=-终端误差-碰撞罚,KL 锚定 BC | DAgger 轮次打满后趋势停滞(Swift/REAP 配方) |
| 同伦链内化 | 训练"给定粗解输出更优解"的 refinement 算子(同伦链中间解为教材),推理时网络自迭代 K 次 | 逼近 0.2m 一线时的最后一压(Berkeley: NN+1-2步≈求解器精度) |
部署可选项:短周期滚动重规划(每 0.5-1s 用最新状态重新前向,工业界 100% 共识做法)——不影响主指标验收,上线时按产品需求决定。
| 项 | 详情 |
|---|---|
| 地址 / 接入 | ssh -p 53198 root@8.149.76.169(按需开机,用完即关省钱模式) |
| GPU | 48Q · 48G 显存(vGPU)——48Q 卡实测过夜档 batch 4096 稳定;OOM 天花板 45.7G,过大 batch 会炸 |
| CPU / 内存 | 16+ 核,实测稳定跑 15 个 IPOPT worker(峰值 2.2G/进程)——重解工程时代验证过,单机 DAgger 重解的底气 |
| 软件栈 | torch 2.7.1+cu126(⛔必须 pin,勿升级) · casadi/IPOPT 已部署(v412_work) |
| 磁盘 | /root/v412_work(训练产物 + 重解脚本)· warehouse 数据按需同步 |
| 历史战绩 | V4.12(1.81m)→ V4.13(2.02m/同题对决位置精度优 53%)两代训练机;best 模型已备份本机 v412_work/best_model_v413_2.20m.pth |
| 开机后 checklist | ① 驱动自检(vGPU 免重启修复:cudaDeviceReset)② 磁盘余量 ③ seed 段登记表查表(已用 600-1100K / 2M / 2.2M) |
注:169 当前关机(2026-08-27 探测);CPU/内存为历史实测口径,开机后以实测为准刷新。
| 阶段 | 内容 | 验收门 | 算力/时长 |
|---|---|---|---|
| P0 基建裁决 | ① 同伦类标签统计实验(换向次数/路径族聚类,定 MoE 路由依据)② Sobolev 灵敏度提取管线(IPOPT KKT 回代)③ 5K 小模型 A/B:物理一致性 loss + goal-frame vs 基线 | ① 类分布可分且稳定 ② 灵敏度有限差分校验通过 ③ A/B 显著优 → 支柱②④进主菜 | 169 半天 |
| P1 base 训练 | 45K 数据全量:goal-frame 表示 + 物理一致性 loss + 构造式输出头(GPU/CPU 流水线起点) | 趋势门:开环单发 <1.2m | 169 GPU 1-2 天 |
| P2 同伦 MoE | P1 基础上加 MoE 分专家重训;Sobolev 灵敏度辅助 loss | 趋势门:开环单发 <0.8m | 169 GPU 1-2 天 |
| P3 DAgger 自举 | 闭环采 3 万状态/轮 → warm-start 重解 → 混训迭代 2-3 轮(169 CPU 与 GPU 流水线并行) | 趋势门:闭环 med 持续下降至 ≤0.5m | 169 CPU+GPU 5-8 天 |
| P4 终局对决 | 500 条固定真场景:V4.14 vs V4.13 vs expert 同题;分场景/分同伦类报告 + 网页 demo | 硬门:单次前向 med ≤0.3m、p90 ≤0.6m、零碰撞 ≥90% | 半天 |
预计总周期 ~10-14 天(DAgger 轮次是主要变量)。全程只用 169 + 本机,零额外机器费用。
| 字段 | 现状 | V4.14 新增 |
|---|---|---|
| 同伦类标签 | 无 | homotopy_class(换向次数+路径族聚类 ID,MoE 路由 + 分场景评估用) |
| KKT 灵敏度 | 无 | dx_dp(IPOPT 回代 ∂x*/∂p,Sobolev 蒸馏监督信号) |
| DAgger 样本 | 无 | state(nn到达), u_expert(IPOPT重解), source_model_version, is_recovery |
| seed 登记 | 手工记 | seed_registry.json 全局表(已用 600-1100K / 2M / 2.2M) |
| 风险 | 概率 | 对策 |
|---|---|---|
| 同伦类边界细碎,MoE 增益不及预期 | 中 | P0 统计实验先行裁决;卡 0.4m 时启用多候选储备牌(顺路技术) |
| DAgger 3 轮不够,需要 5 轮 | 中 | 周期弹性 10-14 天已预留;每轮成本递减(warm-start 越来越准) |
| DAgger 重解成功率低(NN 状态无解) | 中 | 失败状态 = 最高价值纠正数据(is_recovery 标记,高优先 buffer);失败率>30% 回退混更多 expert |
| 可微 rollout 与 BC loss 冲突训练不稳 | 低 | 分阶段课程:先纯 BC 收敛,再逐步加物理残差权重(P0 A/B 校准配比) |
| 0.3m 终局差一口气 | 中 | 储备牌按序上:多候选 → RL 后训练 → 同伦内化;每张都有独立文献证据 |
| 时间 | 事件 | 细节/变更 |
|---|---|---|
| 08-27 17:00 | 169 开机自检 ✅ | 32核/62G/RTX5880-Ada-48Q(48G空闲)/torch 2.7.1+cu126 CUDA可用/casadi 3.7.2/v412_work 完整(best_model_v413.pth 在位) |
| 08-27 17:12 | 数据同步事故与修复 | ⚠️ 首次打包用 tar 默认模式,samples/ 里是指向本机绝对路径的 symlink,169 上全部断链(45,964 条解析失败 100%)。治本:tar 加 -h(dereference) 打真文件 103M 重传,全量可读。教训:warehouse 的 samples 目录本体是 symlink 集合,任何打包必须 -h |
| 08-27 17:20 | P0-① 同伦类统计(裁决①) | 重大发现:换向次数维度无多模态——100.0% 样本都是 1 次换向(45,962条)+2条0换向。原设想的"按换向次数分同伦类"不成立 |
| 08-27 17:25 | P0-①b 细分维度统计(裁决②) | 真正的多模态在运动模式:先进后倒 72.3% vs 先倒后进 27.7%(干净的二模态);航向变化全部左转(med 93°, p5-p95: 40°-145°) 无右转模态;长度比连续分布无聚类结构。裁决:MoE 的"类"= 先进/先倒 二模态(4 组合类: 先进·长前45.8% / 先进·长倒26.5% / 先倒·长倒14.5% / 先倒·长前13.2%)。支柱③ 从"多类 MoE"修正为"双模态专家(2-4 expert)",复杂度下降 |
| 08-27 19:20 | P0-③ A/B/C 架构裁决完成 ✅ | 5K训练/300条固定验证/闭环真RK4评估: A组(轨迹级+goal-frame+物理loss) med 0.28m / p90 0.70m / 碰撞68% — 5K数据即触0.3m线; B组(轨迹级纯BC) med 3.71m; C组(反应式V4.13架构) med 5.25m。三裁决一次出清: 轨迹级胜出(13-19倍), goal-frame+物理loss配方价值确认, A组ep100未饱和。弱点: 碰撞率68%距90%目标远 → P1加碰撞权重课程(2→8) |
| 08-27 21:50 | P1 全量训练启动 🚀 | 44K训练/1000验证/300ep/batch 256/碰撞权重课程(col_w 2→8 前1/3爬升)/score=med+0.1×coll_rate 择优存best。监控cron每小时巡检。A组曲线: ep20→2.1m, ep60→0.62m, ep100→0.28m, 全程陡降未饱和——44K×300ep 有望显著低于0.28m |
| 08-28 01:36 | P1 训练收官(ep300) | 44K+300ep+碰撞课程(2→8, ep100封顶)跑完, 正常退出。终值 ep300: med 0.902m / p90 3.11m / mean 1.33m / 碰撞 13.6% (loss 6.79)。best 按 score=med+0.1*coll_rate 始终停在 ep40(med 0.715m/碰撞36%/score 0.751), ep300 score 0.916 未超越。结论: 课程把碰撞从36%压到13.6%有效, 但 med 容量被抢后未回到 0.72m 以下(平台期 0.83-0.95m)。距硬门 med≤0.3m 差 0.42m、零碰≥90%(碰撞≤10%)差 3.6pp。P2 建议: ①碰撞损失改 hinge-only(只罚实际碰撞样本)或 col_w 封顶 5, 释放容量给 med; ②DAgger 增量数据(重解失败案例)扩充; ③可从 ep250-300 checkpoint 热启(碰撞已低)微调降 med。注: ep150 判读点当时通过(med 已回落<1m), 无课程副作用事故 |
| 08-28 05:53 | P1 终局裁决 + P2建议 | P1 跑满300ep正常结束(236.9min)。终值 ep300: med 0.902m/p90 3.11m/碰撞13.6%; best=ep40: med 0.715m/碰撞36%(score 0.751)。课程(col_w 2→8)把碰撞 36→13.6% 但 med 0.72→0.90、p90×2, 容量抢占坐实。距硬门(med≤0.3m 且 碰撞≤10%): med 还差2.4-3.0倍, 碰撞差3.6pt(ep300口径)。P2: ①基于 ep40 best.pth 改 hinge-only 碰撞损失或 col_w 封顶5 重训; ②脚本补 last/periodic checkpoint(ep300权重已丢); ③eval best 判据改 med+0.3*coll 防best偏向单指标 |
进行中:P1 全量训练(44K/300ep,预计过夜)→ P2 双模态专家 → P3 DAgger 自举。Sobolev 灵敏度管线转 P2 前置(A 组配方已显著有效,灵敏度蒸馏作为增益项并训)
| 时间 | ep | med | 碰撞率 | 判读 |
|---|---|---|---|---|
| 08-27 23:12 | 80 | 1.86m | 23.9% | ⚠️ med 反弹(课程副作用), 碰撞单调降 39→24%, best(0.72m/36% @ep40)已锁存; ep150 判读点 |
| 08-27 23:42 | 150 | 1.45m | 18.3% | 🔴 ep150判读点: med未回落(ep140 0.92→ep150 1.45, 单轮反弹+58%), 距ep40 best(0.72m)仍差2倍; 碰撞降至18.3%——课程在抢容量, 建议停训改配方(hinge-only碰撞或col_w封顶5), 待用户拍板 |
| 08-27 23:49 | 170 | 1.12m | 16.3% | 🟢 副作用消退信号: ep150的1.45m已回落(ep160 1.05m/16.3%, ep170 1.12m/22%), 碰撞续降至16.3%创新低; ep150停训建议暂缓, 继续观察到ep200-220再判——若med稳定<1.2m且碰撞<20%则课程生效, 冲刺ep300 |
| 08-28 00:06 | 190 | 1.19m | 16.5% | 🟢 副作用消退确认: ep160-190 med 稳定在 1.05-1.29m 区间(未再触及1.5m), 碰撞 16.3-22% 区间震荡; 维持原计划, ep200-220 若 med<1.2m 且碰撞<20% 则判课程生效, 冲刺 ep300 |
| 08-28 00:23 | 210 | 0.93m | 17.5% | ✅ 课程生效判读通过: ep200-210 med 1.09→0.93m 跌破1m(ep40后最优, best 0.72m 在望), 碰撞 17.5-18.2% <20% 达标; ep150 停训建议撤销, 冲刺 ep300 看能否 med→0.7m/碰撞→10% |
| 08-28 00:55 | 250 | 0.83m | 14.4% | ✅ 新best已锁存: med 0.83m/碰撞14.4%(score 2.27, 大幅优于ep40的4.32), 双指标续降且均创ep40后最优; ep220-250 趋势稳定向好, 无需干预, 直至ep300收官(预计~1.5h后) |
| 08-28 01:36 | 300(终) | 0.90m | 13.6% | 🏁 P1收官: ep300 med 0.902m/碰撞13.6%, 训练正常结束(进程退出, GPU 0MiB)。⚠️更正: p1_best_result.json 实际仍为 ep40(med 0.715m/碰撞36%, score 0.751), score=med+0.1*coll_rate(小数), ep250那条"新best已锁存"是把coll当百分数算的误记, best从未被刷新。终局双指标距硬门(med≤0.3m, 零碰≥90%)均未达: med差0.42m, 碰撞差3.6pp |
| 08-28 05:53 | 300(终) | 0.90 / best 0.72@40 | 13.6% / best 36%@40 | 🏁 终局裁决: ep300 med 0.902m/碰撞13.6%(距硬门 med 3.0倍/碰撞差3.6pt); best.pth=ep40(0.715m/36%, 距硬门 med 2.4倍/碰撞差26pt), ⚠️ ep300 低碰撞权重未落盘(仅存 best)。两 checkpoint 各占一头, 均未达标。P2建议: ① 从 ep40 best 出发, hinge-only 碰撞损失+col_w 固定4-5(不再课程); ② 训练脚本补 save last/periodic ckpt 防权重丢失; ③ p90 恶化(1.56→3.11m)需加尾部样本加权 |
① 方案整体通过(四大支柱 + 储备牌机制 + 0.3m 口径);
② 169 开机时间(P0 半天出基建裁决结果,P1-P3 连续用机);
③ 部署期滚动重规划:上线时开 or 关(不影响验收,仅产品决策)。
当前状态:V4.14 已收官(2026-08-28)——P1 跑满 300ep:med 0.90m / p90 3.11m / 碰撞 13.6%,距 0.3m 硬门差 3 倍,单次前向口径撞天花板。后续走滚动重规划,见 V4.15 →。页面规则:讨论阶段只写定稿方案;进入实施阶段后,本页须完整记录实施细节与全部修改过程(P0 起每个阶段的实测数据、变更原因、回填测试报告)。