跳转至

最近更新

flow matching
【史上最全Flow matching速成】 这个视频里的可视化让我第一次明白 flow matching 到底做的是件什么事
KL 散度数学推导
KL 散度数学推导
前言 主要是在看 VAE(Variational Auto-encoder) 的时候,VAE的损失函数涉及到 KL 散度 $$\mathcal = \mathcal + \mathcal$$ 其中 $\mathcal = \frac \sum^(\mui^2+\sigmai^2-\log \sigmai^2 - 1)$ 作用是让编码器产生的潜向量分布 $q(z | x)$,尽量接近标准正态分布 $p(z) = N(0, I)$ 这个损失函数里出现 KL 散度的意味是 VAE的过程: - $x$:输入图片z:潜变量,也就是压缩后的一组数字 - $q\phi(z|x)$:编码器给出的潜变量分布 - $p(z)$:我们希望潜变量服从的先验分布,通常设成标准正态分布
RNN & Transformer | ShusenWang
神,或许之后复习的时候会把笔记记一遍,但先刷一遍再说 【RNN模型与NLP应用(3/9):Simple RNN模型】 【RNN模型与NLP应用(4/9):LSTM模型】 有点像ResNet版的RNN 【RNN模型与NLP应用(7/9):机器翻译与Seq2Seq模型】 encoder是通过decoder的loss反向传播进行训练的 太复杂了RNN,感觉就是硬凑出的答案,硬堆,没有触及本质,所以不可能长久 【RNN模型与NLP应用(8/9):Attention (注意力机制)】
NLP 基础
【RNN模型与NLP应用(1/9):数据处理基础】 【RNN模型与NLP应用(2/9):文本处理与词嵌入】
github page 域名更换相关
想把这个目前这个网页做成专门的笔记本,然后新开一个博客 博客就用来写不太成体系的,note就是记有体系的笔记 要把域名更换一下,目前blog.jambitx.top换成note.jambitx.top 记录一下要做些什么 要改哪些地方 1. mkdocs.yml 这个会影响 MkDocs 生成的 canonical URL、sitemap、部分插件里的绝对链接等。虽然页面通常不靠它才能打开,但正式站点最好改对。 2. docs/CNAME 这个仓库是用 mkdocs gh-deploy --force 发布到 gh-pages 分支,docs/CNAME 会被 MkDocs 复制到最终站点根目录,GitHub Pages 会用它识别自定义域名。 3. Github pages 设置
OPD 学习
OPD 学习
去递归学习了,待完善、、、 【40分钟了解OPD的主要工作:为什么RL时代还需要On-Policy Distillation】 【研3基本功+1】你难道还没学过 OPD 吗?(On-policy distillation 基础知识)】 大模型后训练中常见的技术 - SFT: 模仿学习,使用专家的数据进行微调 - RLVR: 强化学习后训练技术,缺点:奖励稀疏 - OPD: 让模型先生成自己的序列(?)然后再让更强的 teacher 模型给出相应的... 强化学习就像没有教练地玩游戏,但每场比赛只收到一次胜利/失败 蒸馏就像观看大师下棋,经管能观察到非常强的棋步,但他们是在新手玩家很少会遇到的棋盘状态下进行的 结合两者的优点,就是On-Policy Distillation,核心是从Student Model中采样轨迹,并使用教师模型对每个token进行评分
论文阅读:VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
总览 VLA-OPD:通过 On-Policy Distillation,把 VLA 模型的离线 SFT 和在线 RL 连接起来 - VLA: Vision Language Action, 视觉语言动作模型,机器人根据图像和语言指令输出动作 - OPD: On-Policy Distillation,在学生模型自己实际到达的状态上,让教师模型给监督信号 - Reverse KL - (离线)SFT: Offline Supervised Fine-Tuning,用收集好的静态专家数据,对模型进行监督微调 SFT: 监督微调 Supervised Fine Tuning ... 这篇论文的核心:VLA 后训练方法 一个预训练好的 VLA 模型已经有一些通用能力了,但部署到具体机器人任务时还不够可靠,那后续应该怎么训练他,才能又快又稳又不遗忘原来的能力?
论文阅读 Causal World Modeling for Robot Control (Lingbot-VA)
论文阅读 Causal World Modeling for Robot Control (Lingbot-VA)
论文链接 啥是 Lingbot-VA 1. 传统的 VLA policy 视觉观察 + 语言指令 -> 动作 2. WM 作为模拟器 3. video prediction / future prediction 辅助 policy Ctrl World 是:action -> video 传统 VLA 是:video -> action LingBot-VA 是:video <-> action,在同一个时间序列里互相条件化 它在每个自回归 step 里既预测 future visual states,又解码 corresponding actions,让两个 stream 互相影响
SkillPlug: Unsupervised Skill Mining for Few-Shot Adaptation in Robotic Manipulation
npm
npm 是什么 npm 由3个不同的部分组成 - 该网站 - CLI (Command Line Interface) - 注册表(JS 软件) npm 是 node bash 工具 npm之于node.js,就像pip之于python 为什么要有 npm 没看懂 Node.js的开发者缺少一个包管理器,就把npm内置在node.js里了
注意力机制初学
注意力机制初学
这是第一次学的时候记的笔记,可能会过于简单、啰嗦,而且后面没记完,完整的 Transformer 梳理在另一篇笔记里。 经典公式 $$Attention(Q, K, V) = softmax(\frac}}) V$$ 每个 token 都有一个 Query 和 Key: $$ Q = \begin q1 \\ q2 \\ q3 \\ q4 \end,\quad K = \begin k1 \\ k2 \\ k3 \\ k4 \end$$ 那么: - $dk$ 是 Key 向量的维度,除了之后先让点积变小一点,再 softmax,把数值控制在合适的范围 Q K V 从哪里来 每个 token 被嵌入为一个向量,把他们堆起来,得到输入矩阵
Ctrl World
Ctrl World
TL;DR Ctrl-World = 一个面向机器人操作的可控生成式世界模型。 它的输入是:当前多视角图像、历史帧、机器人位姿、未来动作序列。 它的输出是:执行这些动作后的未来多视角视频。 它的用途是:让 VLA 策略在“想象环境”里闭环 roll out,用于低成本评估和生成成功轨迹来微调策略。 这篇论文的核心贡献不是单纯把机器人视频生成得更逼真,而是让视频生成模型具备 多视角、动作可控、长时序一致、能和策略闭环交互 这些机器人学习真正需要的能力。 痛点 评测一个机器人策略好不好要在真实机器人上反复rollout,这里把痛点写成了两点: - 严格的评估需要大量的现实世界的推出 - 系统的改进需要额外的纠正数据与专家标签
Transformer 完整梳理
Transformer 完整梳理
架构图 下面的例子中: - $d$ = 6 1. Encoder: Input Embedding 和位置编码 原论文使用的位置编码: $$PE(pos, 2i) = \sin (\frac}})$$ $$PE(pos, 2i + 1) = \cos (\frac}})$$ 最初输入是: $$XE = \sqrt} E + PE$$ 顺便把 decoder 的最初输入给说了
第七章 现代卷积神经网络
AlexNet 回顾LeNet与AlexNet架构 更多细节: - 激活函数从sigmoid变成了ReLu - 隐藏全连接层后加入了丢弃层 - 数据增强 总结: - 就是一个更大更深的LeNet,参数 10,计算复杂度 260 - 加入了丢弃法、ReLU、最大池化层、和数据增强 - 是神经网络热潮的开始
Diffusion Model 学习
Diffusion Model 学习
【扩散模型 - Diffusion Model【李宏毅2023】】 这个博客用 diffusion model 实现了手写数字识别 diffusion model 有很多变形,这里主要讲 Denoise Diffusion Probabillistic Models (DDPM) 论文链接 Diffusion Model 如何运作(生成一张图片) 1. 生成出一张同样规格的,有 noise 的图片 2. 通过一个 denoise network (这个 denoise model 是什么样的后面再讲) 3. 输出滤掉一点 noise 的图片 4. 不断 denoise denoise 步骤一般会有一个编号,从 step 1000 一直降到 step 1 这整个过程叫 reverse process
CS336初识
CS336初识
课程主页 https://cs336.stanford.edu/ 作业一 Github repo 如何做作业? clone下来官方作业仓库,把原 remote 仓库地址命名为上游(仅仅是一个分支名),然后自己开一个远程仓库,把本地仓库的 remote 改成自己的仓库,push 上去 里面都是英文,看起来会很花时间、、、 这门课在学什么? Assignment 1: Basics 内容是:实现训练标准 Transformer language model 所需的组件,包括 tokenizer、model architecture、optimizer,然后训练一个最小语言模型。 作业一的简单理解: 5个作业简写了:basic, system, scaling laws, data, alignment
CS336 BPE 分词器
BPE 简述 用原始文本训练分词器,构建为数据量身定制的词表,常见的序列会被表示成一个token,罕见的序列会被拆成多个token Transformer 的成本和序列长度强相关,self-attention 的计算量近似是 $O(n^2)$ 还影响上下文长度,上下文长度一般以 token 为单位 BPE 是一个启发式的、数据驱动的 1. 模型应该在序列的 chunk,也就是抽象后的文本块上运行 2. 这些 chunk 应该是可变的,从而把更多模型能力分配给更值得处理的部分(难的部分获得更多计算) - 一小段连续字节 - 一组字符 - 一个自动学习出来的文本片段
具身智能术语扫盲
具身智能术语扫盲
Vision-Language-Model,即视觉语言模型,同时处理图像和文本两种模态信息。 打破视觉和语言之间的壁垒,让 AI 具备跨模态理解能力,这是具身智能的基础:机器人要首先看懂周围的环境,才能进一步行动。 VLM 的技术架构: 由 视觉编码器、投影层(适配器)、大语言模型 组成 - 视觉编码器负责将图像转换成向量表示,通常使用 ViT(Vision Transformer)等预训练视觉模型 - 投影层的作用是把视觉特征映射到语言模型的嵌入空间,让两种模态的信息可以对齐 - 最后大语言模型负责融合视觉和文本信息,生成回答 Vision-Language-Action,视觉语言动作模型,相比于VLM更进一步于“怎么做” 从视觉输入和语言指令中,生成机器人可以执行的动作序列 VLA的技术架构:
Mkdocs
Mkdocs
materialX 的开发者的网站 一个 material 的配置写的很详实的网站 内置表情和图标 mkdocs-document-dates 插件 Front Matter 设置 不蒜子阅读量统计 想给静态站点显示“阅读 N 次”,核心是:MkDocs 只负责生成页面,访问次数必须交给外部服务或后端保存。这里改用不蒜子做前台阅读量展示,不需要自己买服务器。 不蒜子的页面访问量 不蒜子会自动识别一些固定 ID,并把统计数填进去: 其中:
乐理
三和弦的构成与音程 两个音之间的左闭右闭区间有几个音就是几度,不过度数前面还有修饰词: - 一度:同音 - 小二度:1个半音 - 大二度:2个半音 - 小三度:包含3个半音(全+半) 大二+小二 - 大三度:包含4个半音(全+全) 大二+大二 - 纯五度:包含7个半音 4种3和弦对照表 C Major