{{detailStore.author.is_follow?'已关注':'关注'}}
无论是理想,或者是小鹏 VLA ,在适配 Orin 平台老用户中都遇到同一个问题:模型本身没法直接迁移,大家基本重新都花了一遍精力,在Orin平台重新做了一遍。 甚至不排除,Orin用户跑出来的味道和旗舰版本不一定完全类似,或者完全就是阉割,可能很多细节体验都不一样。 我简单和大家做个比方: 这次自研芯片后这几家,都是先用大厨(教师模型)做出顶级味道,再训练学徒(学生模型)复刻,学徒训练的时候,就提前想好最终上菜的容器有多小、能装多少东西(比如硬件约束了多少)。 所以这个做菜思路可以复制,是同源的,但是来到Orin后其他全变了。 容器换成 Orin后,相当于盘子尺寸、烤箱功率全都变了。学徒的饭量、配方、调味比例,都要重新调整。不能直接拿适配大烤箱的配方,直接放到小烤箱里烤。思路可以学,但菜必须重新做。 所以传统模型蒸馏。比如拿一个大教师模型,直接把它的输出答案喂给小模型,一次性训练完事,这种就行不通。 理想这次提到一个新架构,就是教师模型先做架构搜索,先找一个最适配 Orin 芯片特性的网络骨架,用离线蒸馏,老师拿着全套习题集,一次性把解题思路、中间思考过程全部写好,给学生刷题。 理想还提出一个在线蒸馏的方法,就是在训练的时候,让教师模型和学生模型同时跑,实时对比两者的输出差异,教师模型会实时评判对错,持续给反馈。 最后做量化,让学生模型从训练阶段就适应压缩带来的精度损失,更好的跑在 Orin 上。 所以很多人会误以为,给 Orin 老车做 VLA,只是把新平台大模型简单裁剪、砍参数,做降级阉割,为什么要等这么久。 其实各家都在以强能力的教师模型为知识蓝本,从零训练、孵化出一个适配 Orin 硬件限制的全新学生模型,都是真金白银的投入,相当于让 VLA 能力在 Orin 平台上真正 “重生”了一次!
  • 全部评论{{detailStore.commentnum}} 条
  • 只看作者
  • 最热
  • 最新
  • 最早

「待审核」

首评 {{ comment.relativeTime }} 已被赞赏 {{comment.integral}} 积分 回复

{{ type!=10 ? '前排沙发空着~' : '暂无相关评论' }}

{{type!=10 ? '还没有人评论哦,快抢沙发吧!' : '发表一下个人看法吧'}}
写评论
积分赞赏
点赞
评论区
  • 编辑
  • {{ is_favourite ? '已收藏' : '收藏' }}
  • {{ is_personal_top ? '取消主页置顶' : '个人主页置顶' }}
  • 举报
  • 加入黑名单
  • 内容{{ eyes_only ? '公开' : '仅自己' }}可见
  • 删除
  • 取消置顶
  • 置顶推荐
    • 6小时
    • 12小时
    • 24小时
    • 3天
    • 一周
    • 长期
  • {{ feature?'撤销':'进' }}精选库
  • {{ digest?'撤销精华':'设为精华' }}
回到顶部