Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.019 — 2026-07-23
PAPER 约 1 分钟

AV-JEPA把声音纳入联合预测

AV-JEPA让声音与画面从训练早期共同学习,用更简洁的结构对齐跨模态信息。

看一段狗叫视频,人很自然地知道叫声和画面来自同一件事,AI 却通常需要人工标签或复杂结构才能建立这种联系。AV-JEPA 把 JEPA(在压缩后的抽象表示中预测信息,而非还原每个像素)从纯视觉扩展到音视频:声音与画面在处理早期就进入同一个 ViT(用于处理图像序列的神经网络),共同学习可迁移的表示。

最巧的一步是“模态丢弃”:训练时交替拿走声音或画面,让模型仅凭一种信号去接近完整音视频的抽象表示。这样既形成跨模态预测任务,也省去了重建解码器、对比学习负样本和教师模型。作者报告,模型在 VGGSound 分类上达到 57.1% top-1;但仍低于论文列出的重建式方法 63%—67% 的成绩。它的价值更像一个简洁基线:证明 JEPA 路线能直接学习共享的音视频空间,而非已经刷新最佳性能。


供稿材料 SOURCES — 1

← 返回 2026-07-23 · 学术板块