Robostral Navigate 是什么?
2025 年,Mistral AI 发布了 Robostral Navigate,这是他们第一个专门为机器人导航设计的 AI 模型。它像一个 8B 参数的“大脑”,能接收普通摄像头拍到的画面和一句自然语言指令,比如“离开大厅,穿过走廊,进入储藏室,停下来面对第二个架子”,然后指挥机器人完成整个任务。
这个模型完全由 Mistral AI 内部开发,不依赖任何开源视觉语言模型。官方没有说明它是否开源,但强调它只用了一个普通 RGB 摄像头,没有深度传感器或激光雷达,就能在复杂环境中自主导航。
它如何工作?
Robostral Navigate 采用“指向式导航”方法。它根据当前摄像头画面,预测目标位置在图像中的坐标,以及到达时应该朝向的方向。这就像你看着一张照片,用手指指出“我要去那里”,而不是用尺子量距离。
如果目标不在视野内,它会改用局部坐标位移,比如“向前走 2 米,向左 1.5 米,左转 25 度”。这种方法让模型对摄像头参数和世界尺度变化不敏感,更灵活。
训练过程:模拟数据与高效算法
模型在模拟环境中训练,生成了约 240 万条轨迹,覆盖 35 万个场景。训练时使用了一种叫“前缀缓存”的高效算法,把整个任务压缩成一个序列,一次前向传播就能处理所有时间步,同时防止信息泄漏。
相比传统方法,这种算法减少了 22 倍的训练 token,把原本需要几个月的训练缩短到几天。这就像把一本厚书浓缩成一张思维导图,学起来又快又全。
强化学习提升性能
在监督训练后,Mistral AI 使用在线强化学习算法 CISPO 进一步优化模型。这让模型能从错误中学习,恢复失败,并探索新行为,解决了行为克隆的分布偏移问题。
这一阶段单独提升了 3.2% 的成功率。原文表示性能尚未达到平台期,更多训练和实验有望继续提升。
性能表现与优势
在 R2R-CE 基准上,Robostral Navigate 在验证 seen 上达到 79.4% 成功率,在 unseen 上达到 76.6%,超过了最佳单摄像头方法 9.7 分,也超过了使用深度或多摄像头系统 4.5 分,尽管它没有使用这些传感器。
模型能运行在轮式、腿式和飞行机器人上,并适应不同机器人尺寸和摄像头参数,展现出很强的泛化能力。
应用场景与未来
这项技术可用于制造、配送、物流和酒店等行业,让机器人自主完成长程任务,适应真实环境中未见过的人和障碍物。Mistral AI 认为导航是通用机器人技术的基础能力。
Robostral Navigate 只是迈向统一具身智能体的第一步。公司正在扩大机器人团队,并计划继续开发更强大的导航模型。
限制与适用人群
目前模型主要面向企业和研究机构,官方未说明个人使用方式。它依赖单摄像头,在目标超出视野时需依赖位移指令,可能影响精度。
适合对机器人导航感兴趣的开发者、研究人员和工业用户。小学生可以把它想象成一个聪明的向导,但实际部署需要专业知识和硬件支持。
本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。