研究解读 · 小互解读

Memories.ai 发布 O-MARC:怎么让同时处理视频和声音的 AI 跑得又快、又省,还更准

配套还放出一套测试题,专门用「把音轨删掉再考一遍」的办法,筛掉那些光看画面就能蒙对的题。
一分钟速览
  • 能同时看画面、听声音的 AI 是目前视频理解的前沿,但一秒视频就要吃掉一大把 token。多路摄像头连续跑的成本,是这类模型至今留在实验室的主要原因。
  • Memories.ai 的 O-MARC 做的是「聪明地扔」:只留跟问题有关的关键画面帧和音频锚点,其余当噪声丢掉,推理快 34.6%(1.53 倍)、内存省 34.7%。
  • 压缩通常要拿精度换速度,这套方法用「同一个模型开卷答一遍、闭卷答一遍」的蒸馏训练把精度补回来,四项测试均分 45.8,高过不压缩的 44.1。
  • 压缩组件 OMAC 免训练,装在已经部署的模型前面就能用;想拿到那个更高的准确率,则要跟着做一轮强化学习训练。
  • 配套的 UGC-AVQA 收了 1000 个视频、4816 道题,每道候选题都先删掉音轨考一遍,AI 还能答对的一律剔除,留下的必须听见才做得出来。
材料来自 Memories.ai 的研究页与其 arXiv 论文,效率与准确率均为作者自评数据。文中数字已回论文表格核对适用条件,条件不同处会标注。

Memories.ai 在 7 月 8 日放出了一项叫 O-MARC 的研究成果,配套论文 5 月 26 日已经挂上 arXiv。它解决的是一个很具体的难题:怎么让同时处理视频和声音的 AI 跑得又快、又省,还更准。

痛点

现在的视听 AI 卡在两个地方

一、太贵太慢,算力压根吃不消

模型不是直接「看」视频的。一段视频进模型前会被拆成一串 token:每一帧画面切成很多块,每块是一个 token;音频按时间切成一串 token;再加上你问的那句话。三段拼成一条长序列,模型从头到尾读一遍。

序列有多长,显存和时间就有多贵。而画面和声音都是特别费 token 的模态,两个叠在一起,序列长度直接翻番。

一段视频是怎么变成一长串 token 的
画面(每秒取一帧,一条最多 32 帧) 每帧再切成很多小块 声音(16kHz,按时间切段) 你问的那句话 拼成一条序列送进模型 · 序列越长,显存越大、出结果越慢 …很长

示意图(本站绘制)。橙色深块是画面 token,浅块是音频 token,深灰是文字。一条 32 帧的短视频就是几千个 token。

论文里的实测:即便克制到每秒只取一帧、一条视频最多 32 帧,在 WorldSense 这个长视频测试集上跑一条(64 帧配置)也要 3.81 秒、吃掉 24.2GB 显存。一张卡跑一路就快满了。

3.81 秒
不做压缩时,跑一条长视频的耗时
24.2 GB
同一条视频占用的显存

把这两个数字乘上摄像头路数和小时数,就是监控中心、工厂产线这类要 24 小时连续跑多路画面的场景,成本高到没法接受的原因。

二、装模作样,现在的测试根本测不准

假设你要评估两套视频分析系统,都号称能同时理解画面和声音。你拿现成的音视频测试集跑一遍,A 得 70 分 B 得 60 分。问题来了:A 那 70 分,有多少是靠看出来的?

大多数音视频测试集回答不了这个问题。题目里有相当一部分只看画面就能猜对,比如车祸现场、有人摔倒、机器冒烟,这些不听声音也认得出。一个完全不用音频的模型照样能刷出好成绩,于是「音视频联合理解」这个能力,在评测层面成了一笔糊涂账。

打个比方

你想招一个懂英语的人,出的卷子却全是选择题,四个选项里三个明显不通顺。不懂英语的人靠排除法也能考八十分。这份卷子测不出你要的那个能力。

对要买这类系统的人来说,这意味着没有可靠办法分辨哪家是真的整合了声音信号,哪家只是把音频当摆设。行业缺一份能验证「它真听懂了」的卷子。

Memories.ai 的两位创始人 Shawn Shen 和 Ben Zhou 都是从 Meta 出来的,他俩之前专门负责 Meta 的 Ray-Ban 智能眼镜的 AI 系统,做着做着发现一个绕不过去的问题:眼镜一直在录,可录完的东西用户根本调不出来,AI 看见了却记不住。就是这个痛点让他们在 2024 年离职创业,创办了 Memories.ai,专门研究怎么把视频变成能被检索、能被回忆的东西。O-MARC 是这条线上的最新一步。

突破一

OMAC 怎么挑出该留的画面和声音

先看官方发的这段动画,37 秒讲了三件事。