

先看证据
把机制串起来
多模态模型要把图像、视频等内容变成模型可处理的表示;常见做法是把它们编码成视觉 token,再与文字一起送进 Transformer。KV cache 可以理解为模型在多轮对话里保留的“已读上下文”,共享它意味着不同模态的处理分支能接着同一段状态工作。视频和图像生成常需反复去噪;Flow Matching 是一种学习如何逐步把噪声变成目标内容的生成方法。
Rho-1 的每个 Transformer block 有理解流和生成流两套专家权重:前者处理语言及视觉解析,后者将潜变量去噪为图像或视频;两路共享注意力与 KV cache,因此跨模态任务能沿用累积上下文,但并非所有内容都由同一条计算路径处理。文字、符号推理和高层指令使用离散 token,图像潜变量、视频帧、动作与本体感觉使用连续 token;离散序列用下一 token 预测训练,连续输出用 Flow Matching 训练,各自采用更适合其表示的目标。需要生成像素时,理解
['适合需要跨图像、视频与文字连续编辑的任务', '机器人演示限于模拟;勿直接视作真实部署能力', '低延迟生成可试蒸馏版,先核验画质与一致性', '对延迟或质量要求严格时,先做同硬件独立对照']
减少交接,改变的是系统边界
Reka于2026年10月5日发布Rho-1研究预览版。这是一个从零开始训练、规模为190亿参数的全模态模型,目标是在同一网络中理解和生成文本、图像与视频,并输出机器人动作。它试图回应一个具体的系统问题:多模态任务往往由规划模型把工作交给视觉、视频等专用模型,再由外部流程把结果拼起来。
这次发布值得技术负责人细读,不是因为一段演示就证明了模型可以取代现有系统,而是因为它把优化对象从“调用哪个模型”移到了“任务状态如何跨模态延续”。如果图像、视频、指令和动作确实能在同一上下文中读写,系统或许可以少做一次次请求转换,也可能少丢失前序信息。不过,减少模型间交接只是架构假设,是否降低端到端延迟、是否更容易恢复失败,都需要在真实任务中分别测量。
一个模型,仍有两路计算
Rho-1并非让所有内容都经过一条完全相同的计算路径。Reka描述的Transformer模块包含两路专家权重流:理解流处理语言和视觉解析,生成流把潜变量去噪为图像或视频。两路共享注意力机制和同一个KV cache,因此所谓“一体化”,核心是共享状态与上下文,而不是取消任务专门化。
模型内部使用两类表示。文本、符号推理和高层指令采用离散token,图像潜变量、视频帧、机器人动作和本体感觉采用连续token。需要生成像素时,理解流会发出一个交接token,生成流再依据已经累积的状态进行渲染。训练也结合了离散序列的下一token预测和连续输出的flow matching。这个安排解释了Rho-1试图解决的矛盾:保留理解与生成的专长,同时让它们不必通过彼此独立的模型传递全部上下文。
演示展示了连续上下文,尚未证明普遍优势
Reka给出的交互演示把共享状态呈现得很直观:模型先画出一座灯塔,再框选灯塔,把图像扩展成视频,把场景改成雪暴,最后解释视频发生了什么变化。公司称,这一过程在五轮交互中完成,没有调用工具或第二个模型。它说明系统尝试让生成物继续留在对话状态里,成为后续编辑和解释的依据。
但演示能够证明的是流程可被串在一起,不是各种提示和长对话都能稳定完成同样的事。即使一个模型保留了此前的图像表示,目标定位和定向修改仍可能出错。Reka也承认跨视频目标定位尚不可靠,定向编辑仍然脆弱,较长生成可能出现结构漂移。对工程团队来说,评估重点应从“能不能做出这个样例”转向“在多少输入条件下能保持对象、场景和修改意图”,以及失败后能否识别并恢复。
速度数字必须连同测试口径阅读
基础版的速度数据反映了生成成本并未因架构统一而消失。Reka称,视频生成速度中位数约为实时速度的0.79倍,可观看的视频流约在6秒后出现,演示中的首段视频耗时7秒。发布材料还把这一示例与多代理流水线的13.8秒作比较,但没有给出完整测试设置、重复次数或标准化评测协议,因此不能把单个对照直接外推成所有任务都更快。
更明显的加速来自蒸馏版。Reka称,它把去噪过程从99步降到8步,生成5.3秒视频约需1秒。页面列出的具体编辑示例则耗时约1.11至2.01秒,原生视频分辨率上限为672×384。公司称蒸馏后质量损失很小,并报告其内部测试结果,但没有提供足以独立核验这些说法的完整基准和测试条件。技术负责人可以把这些数据视为值得进一步测试的工程信号,而不应直接写进延迟预算或服务等级承诺。
机器人动作把问题带到仿真之外
机器人部分把共享状态的主张从内容编辑带向控制:Rho-1设想从同一潜在状态预测未来画面并解码动作。Reka展示了LIBERO仿真任务中的7个动作通道,并提出用逆动力学模型从普通视频推断控制信号,以补充稀缺的遥操作数据。公开材料没有披露这条数据管线的完整训练细节,也没有给出实体机器人上的部署结果。
因此,仿真演示不能被读成已经具备真实环境中的通用操作能力。机器人系统还必须判断动作是否可执行、模型对当前状态的理解是否可靠,以及发生偏差时安全层能否及时拦截。模型能够输出动作序列,只回答了控制链条中的一部分问题。对考虑采用这类模型的团队,合理的门槛是先在受控环境中验证动作质量、状态变化与失败处理,再讨论把它接入实体设备。
先验证端到端收益,再谈替换流水线
Rho-1目前更适合作为架构方向的研究预览,而不是可以直接替换生产系统的通用组件。Reka称模型训练使用320张H100、持续3个月,但现有发布材料没有提供独立基准、完整评测协议或同行评审研究来支持广泛的性能结论。权重和公开访问方式也没有在现有材料中得到清楚说明。对希望复现或部署的团队而言,这些信息缺口本身就是评估的一部分。
实际比较时,不应只测单次生成耗时,而应拿同一批任务对照“Rho-1端到端流程”和“专用模型加编排层”,同时记录延迟、编辑一致性、失败恢复成本与动作安全性。共享KV cache可能减少上下文搬运,却不会自动解决长时漂移、脆弱编辑或机器人控制风险,也不保证整体成本更低。判断它是否值得进入系统,应看共享状态是否在目标任务上产生可重复的端到端收益,并且这些收益足以覆盖新的验证与治理负担。