跳到正文
arXiv · 多模态与生成机制· Team Kandinsky; Julia Agafonova; Bulat Akhmatov; Mikhail Aksyutin; Grigorii Alekseenko; Anastasia Aliaskina; Olga Androsova; Vladimir Arkhipkin; Anna Averchenkova; Alexander Belykh; Serafima Bocharova; Sofiya Bogakovskaya; Anton Bukashkin; Mark Bulygin; Kirill Buzygin; Irina Cheremnykh; Kirill Chernyshev; Mikhail Chernyshov; Vladimir Chernyy; David Chikovani; Georgy Daniltsev; Denis Dimitrov; Anna Dmitrienko; Vladimir Dokholyan; Sergey Emelyanov; Dmitry Ermilov; Georgii Fedorov; Polina Gavrilova; Nikolai Gerasimenko; Aleksandr Gordeev; Andrey Inozemtsev; Andrei Ivaniuta; Alexander Ivanov; Mikhail Karaev; Anastasiia Kargapoltseva; Ivan Kirillov; Nikita Kiselev; Valeria Kobenko; Yury Kolabushin; Denis Koposov; Anatoly Korobov; Vladimir Korviakov; Kirill Kozlov; Denis Krzhivokolskiy; Konstantin Kuklev; Alexander Kunitsyn; Sergey Kuzin; Vladislav Lakhtionov; Alexey Letunovskiy; Maxim Litvinov; Alexander Lyulkov; Georgy Makarov; Kirill Malakhov; Egor Malykh; Mikhail Mamaev; Dmitrii Mikhailov; Polina Mikhailova; Ivan Mikheev; Elizaveta Muromtseva; Nikolai Nazarkin; Tatiana Nikulina; Lev Novitskiy; Stanislav Onuchin; Nikita Osterov; Denis Parkhomenko; Anatoliy Parpara; Vladimir Polovnikov; Konstantin Reznikov; Azat Saginbaev; Nikita Samsonov; Alexander Sentsov; Nikita Shaimov; Artem Sherstyuk; Andrey Shutkin; Egor Silvestrov; Bulat Suleimanov; Matvey Suprunov; Sergey Taranov; Irina Tolstykh; Tatiana Trofimuk; Ilya Trushkin; Aleksandra Tsybina; Olga Varlashina; Viacheslav Vasilev; Ilya Vasiliev; Eugeny Vilisov; Sergey Yakubson; Konstantin Zakharov·· 5 天前精选AI 评分73

Kandinsky 6.0 Video:用于同步视频与音频生成的基础模型

Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation

AI 导读

基于摘要分析。Kandinsky 6.0 Video 面向同步音视频生成,核心贡献是将预训练视频流与新训练音频流通过双流 CrossDiT 架构连接,实现文本或图像条件下的音视频联合生成;其主要研究对象是多媒体生成,而非 EEG 解码或 BCI。 模型系列包括 Kandinsky 6.0 Video Lite(3B 参数)和 Kandinsky 6.0 Video Pro(29B 参数)。作者报告,两者均支持 text-to-audio-video(T2AV)和 image-to-audio-video(I2AV)模式,可生成 5 秒视频及同步的 44 kHz 音频,包括唇音同步;内置超分辨率模型将输出提升至 Full-HD(1920×1080)。这些是摘要所述输出规格,不等同于同步质量的量化验证。 技术上,该方法继承 Kandinsky 5.0 的视频生成能力,通过双向跨注意力促进视频流与音频流的时间和语义对齐。持续预训练先在大规模音频语料上从零训练音频流,再使用成对音视频数据联合训练两个流,目标是在联合建模时保留单模态生成质量。随后进行监督微调、基于强化学习的后训练及蒸馏;具体损失、训练规模、奖励设计和蒸馏配置尚未验证。 作者报告,在并排人工评估中,Pro 版本明显优于 Kandinsky 5.0 Video Pro,并与领先音视频生成模型保持竞争力,尤其体现在语音质量上。摘要未提供评估样本、具体对照模型、评分数值或统计信息,不能据此量化优势。作者声明以 MIT 许可证发布代码、模型检查点及 diffusers 集成;资源完整性、推理成本和复现条件尚未核对。 双流对齐机制可作为多模态建模的阅读线索,但材料未建立其与 EEG/BCI 瓶颈的具体对应关系,不能将音视频生成效果视为神经信号任务的有效性证据;相关 EEG 工作尚未检索确认。实验协议、消融及统计信息尚未验证。

阅读价值

双流 CrossDiT 的双向跨注意力及分阶段音视频联合训练值得核对,作者声明开放代码与模型权重,但其同步效果、评估优势及 BCI 适用性尚未独立验证。

来源:arXiv · 多模态与生成机制 · arxiv.org