Decoder-only Transformer · 808K 参数 · 80步闭环推理 · 39.4K 轨迹从头训练
← 返回主页 | V4.4 集成+护盾 | V4.2 单次NN推理 | V3 障碍物感知
① 闭环自回归推理:单步预测(δ,v)→RK4积分→新状态反馈给模型→下一步预测。80步循环,模型每步看到真实位置主动纠偏。
② 无安全层:纯模型推理,不做推理时碰撞干预。零碰撞率99%来自训练质量。
| Epoch | Loss | pos_err | median | p90 | θ₁ | 碰撞 | tf |
|---|---|---|---|---|---|---|---|
| 10 | 0.060 | 1.462 | 1.226 | 2.792 | 7.48° | 92% | 1.00 |
| 20 | 0.052 | 0.929 | 0.709 | 2.037 | 4.23° | 99% | 1.00 |
| 30 | 0.048 | 1.905 | 1.360 | 4.124 | 6.45° | 99% | 1.00 |
| 40 | 0.043 | 1.942 | 1.701 | 3.901 | 6.55° | 99% | 1.00 |
| 50 | 0.038 | 1.547 | 1.515 | 2.312 | 3.99° | 99% | 1.00 |
| 60 | 0.034 | 0.476 | 0.452 | 0.717 | 1.52° | 99% | 0.87 |
| 70 | 0.031 | 0.285 | 0.241 | 0.504 | 1.07° | 99% | 0.73 |
| 80 | 0.027 | 0.296 | 0.205 | 0.451 | 1.04° | 99% | 0.59 |
| 90 | 0.025 | 0.291 | 0.229 | 0.440 | 1.23° | 99% | 0.45 |
| 100 | 0.025 | 0.281 | 0.118 | 0.413 | 1.40° | 99% | 0.31 |
V4.6 是一个从零训练的 Decoder-only Transformer,仅 808K 参数,在 39.4K 轨迹上训练 100 轮。无需安全层、无需集成——99% 零碰撞率完全来自模型自身的闭环自回归推理能力。
| 项目 | 数值 |
|---|---|
| 训练轨迹 | 39,400 条 |
| 子片段(sub-segments) | 2,840,000 |
| 训练轮数 | 100 epochs(从头训练) |
| Batch size | 2,048 |
| 学习率 | 1e-3, cosine annealing |
| 训练时间 | ~41 小时 (CPU, 腾讯云) |
| 最终 Loss | 0.025 |
① θ₂ 可微前推(λ=0.5):通过可微前向仿真注入 θ₂ 角度误差。不同于仅惩罚最终状态误差,可微 rollout 将挂车角度误差沿轨迹传播,使模型学到更平滑的铰接控制。
② Scheduled Sampling:teacher-forcing ratio 从 1.0 线性衰减至 0.31(epoch 50-100)。前半段用真实轨迹训练(稳定收敛),后半段逐步过渡到模型自身预测(缩小 train-test gap)。这是 V4.6 从 ep60 起性能急剧提升的核心原因。
③ 完整余弦调度:完整的 0→100 epoch 余弦学习率循环,确保训练后期能充分收敛到 sharp minima。学习率从 1e-3 平滑衰减至 0,后期极低的学习率让模型在最优解附近精细调优。
| 指标 | V4.4 旗舰 | V4.6 |
|---|---|---|
| 架构 | 6×Transformer 集成 (807K×6) | 单 Transformer 808K |
| 推理策略 | 6模型并行 + Safety Shield | 纯模型闭环自回归 |
| 安全层 | 有(逐步碰撞干预) | 无 |
| 训练数据 | 8,292 轨迹 | 39,400 轨迹 |
| 训练轮数 | 各模型 200-500 epoch | 100 epoch 从头训练 |
| 位置误差 (mean) | 0.25m | 0.281m |
| 位置误差 (median) | — | 0.118m |
| θ₁ 误差 | 1.0° | 1.40° |
| 零碰撞率 | 100%(含安全层) | 99%(纯模型) |
| 严格成功率 | 75% | — |
| 推理时间 | 1-2s(6模型串行) | ~0.2s(单模型) |
| 参数总量 | ~4.8M (6模型) | 808K (1模型) |