当前位置: 首页 > news >正文

小鸡毛的具身智能VLA入门自学路线

文章目录

  • 个人背景参考
  • 基础知识
    • 1. Python语言
    • 2. 深度学习入门
    • 3. PyTorch框架
    • 4. Transformer架构
  • 理论进阶
    • 1. 生成模型
    • 2. 模仿学习
    • 3. 强化学习
    • 4. 大模型基础
  • 入门VLA
    • 1. OpenVLA
    • 2. Pi系列
  • 完成项目
  • 算法题
  • 一些个人想法(后续更新)

个人背景参考

我在有一些C语言、git、linux、ROS的基本使用基础,SLAM方面的理论基础,了解部分传感器使用的情况下,大概花了300小时左右完成了对下列内容的学习来入门具身智能VLA领域

基础知识

1. Python语言

想快速过一遍上手的话,我是直接看了一遍菜鸟教程(runoob.com); 要是时间足够,想详细学一遍的话可以看MIT6.0001

2. 深度学习入门

花两三天快速过一遍鱼书就好,一定一口气看完以免遗忘后前后衔接出问题。网上普遍说跟着敲一遍,我认为完全没必要,了解基本原理即可,后续自己做项目读写代码一样能做到提升。

3. PyTorch框架

时间充裕的话可以听听小土堆的课,想快速入门可以省去这一步,用到PyTorch的时候现场问AI也是没问题的,问几次用几次也熟悉了。

4. Transformer架构

先去网络上搜索关于QKV在NLP中提出的背景和含义进行了解,再去听“炮哥带你学”的相关课程,时间充足的话可以额外跟炮哥做一遍ViT。

理论进阶

1. 生成模型

Flow Matching and Diffusion Models, 6.S184

2. 模仿学习

ACT, Diffusion Policy,先通过AI进行定性了解,再去原论文学习即可

3. 强化学习

赵世钰老师的《强化学习中的数学原理》课程,再去学习PPO, GRPO, SAC等常见算法,学习方法同上,先通过AI定性了解,再回到原论文学习即可

4. 大模型基础

时间充裕的话上LLM: cs336;想快速入门找到实习再慢慢学习的话可以看看飞天闪客、3b1b等科普博主了解流程即可。

VLM: 先学习CLIP,后续读论文遇到什么再临时学习新的架构即可。

入门VLA

1. OpenVLA

比较古早的开源模型,适合快速上手复现微调来了解VLA到底在干嘛,不过不建议花大量时间进行学习,重心推荐放在Pi上,其在未来使用的频率会高得多

2. Pi系列

Pi系列的所有文章和代码都推荐大家详细阅读学习,重点可以按照顺序学习0,0.5,*0.6

完成项目

我个人做过的会逐一记录在博客供大家参考,这里就不详细展开了

算法题

这一项一定不要开始太早,因为我们平时很难用上相关知识,到后面是会遗忘的。

如果有相关基础,我觉得顺手做做hot100,会基本的CNN,MLP,MHA就够用了;

如果和我一样零基础的话,可以先看《算法图解》这本书来形象理解各种概念,再上代码随想录或者labuladong的速成算法网站,最后再来hot100和CNN,MLP,MHA等。不过找具身初创的话,其实手撕考的不多,不准备直接面也是OK的

一些个人想法(后续更新)

http://www.cnnetsun.cn/news/1775391.html

相关文章:

  • 新手友好:MedGemma 1.5快速部署与基础健康咨询全攻略
  • 从物理到艺术:Photoshop混合模式的数学原理与视觉化解析
  • Nanbeige 4.1-3B WebUI应用:打造你的个人二次元AI助手
  • 纯电动汽车再生制动策略:Cruise与Simulink联合仿真的整车与策略模型解析文档
  • Linux 的 mv 命令
  • 银行卡基本信息查询API集成指南
  • 从FP32到INT8:在RK3588开发板上实测RKNN量化对YOLOv5推理速度与精度的真实影响
  • FlowState Lab 与经典统计模型(ARIMA, Prophet)的横向对比评测
  • GLM-4-9B-Chat-1M效果惊艳:长篇小说逻辑梳理+代码库跨文件调试实录
  • LangChain4j 会话记忆存数据库?手把手教你自定义 ChatMemoryStore 接口实现
  • 【ESP32_IDF】利用LVGL实现高效GIF动画播放的实战指南
  • AWPortrait-Z WebUI二次开发解析:科哥定制界面布局与交互逻辑
  • Realistic Vision V5.1与STM32F103C8T6:嵌入式设备图像生成交互原型
  • Chandra OCR应用案例:数学试卷/表单/PDF批量转结构化文本
  • 在Ubuntu 22.04上搞定CanFestival主站:从源码下载到编译验证的保姆级教程
  • 深入FreeRTOS SMP调度器:主核与从核如何“默契配合”完成第一次任务切换?
  • Alpamayo-R1-10B高算力适配:PyTorch 2.8+bf16混合精度部署优化
  • Qwen3-14B-Int4-AWQ效果集锦:从技术文档到创意写作的多风格文本生成
  • 快速入门:Ollama部署Yi-Coder-1.5B,5分钟搭建编程助手
  • 【数据结构与算法】第34篇:选择排序:简单选择排序与堆排序
  • 谷歌更新Gemini心理健康安全防护措施
  • 人脸识别OOD模型真实效果:会议直播截图中关键人物人脸的OOD分标注集
  • 【网络层-ICMP互联网控制报文协议】
  • Hunyuan-MT Pro实际应用:跨国远程医疗问诊记录多语种结构化摘要生成
  • 基于PySide6的YOLO通用检测平台:从零搭建与多场景适配
  • GPU拓扑结构
  • 实测效果惊艳:DeepSeek-R1-Distill-Qwen-1.5B推理能力展示
  • Gemma-3-12b-it真实作品集:10组高质量图片问答对话效果分享
  • nli-distilroberta-base在智能客服中的应用:自动判断用户意图与诉求
  • 和AI一起搞事情#:边剥龙虾边做个中医技能来起号缓