SV-TAD以原生稀疏卷积加速动作检测
先了解这件事
基于摘要分析。SV-TAD针对动态token剪枝破坏空间网格、卷积适配器重建稠密表示可能抵消加速收益的问题,提出原生稀疏二维卷积,使适配器直接处理剪枝后的token。 作者报告:在THUMOS-14与ActivityNet-1.3上,使用VideoMAEv2-L时计算量最多降低64%、推理加速2.2倍,并维持其所称的最佳精度;扩展至InternVideoNext-L后,以约一半计算成本超过此前最佳结果。辅助任务token还改善了ATTACH细粒度装配检测,但提升幅度未披露。 本次新增材料未提供可核对的版本变更。具体精度指标、数据划分、基线、硬件与计时范围尚未验证,两项效率数字是否来自同一设置亦不明确;剪枝策略、稀疏邻域实现及消融尚未验证。现有证据限于视频任务,不能据此确认BCI效果。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv · 在线与高效推理精选SV-TAD:用于高效时序动作检测的原生稀疏卷积
基于摘要分析。该研究针对长视频理解中轻量卷积适配器虽能降低可训练参数量、却未充分降低推理计算的问题,提出原生稀疏二维卷积,并将其集成到时序动作检测框架 SV-TAD,使适配器直接处理动态剪枝后的 token 集合。 核心机制是解决 token 选择与卷积适配器之间的结构冲突:剪枝可降低注意力计算,但会破坏卷积依赖的空间网格,若先重建稠密表示,可能抵消加速收益。作者提出的稀疏算子旨在绕过这一重建步骤。摘要未说明 token 选择策略、稀疏邻域构建、卷积实现、损失函数或训练配置,这些细节尚未验证。 作者报告,在 THUMOS-14 和 ActivityNet-1.3 的时序动作检测评估中,采用 VideoMAEv2-L 时计算量最多降低 64%,推理速度达到 2.2 倍,同时维持作者所称的当前最佳精度;摘要未提供具体精度指标、对应划分、基线配置、硬件及计时范围,无法判断两项效率数字是否对应同一设置。作者还报告,扩展到 InternVideoNext-L 后,以约一半计算成本超过此前最佳结果,但具体指标与对照条件尚未验证。稀疏表示亦支持辅助任务 token,作者报告其改善了 ATTACH 上的细粒度装配检测,未给出提升幅度。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 时频表示采用网格化 token 与卷积适配器,这种避免稠密重建的机制可能用于降低推理开销;该假设不代表已证实的 BCI 效果。可复用的是稀疏卷积处理路径,需改造 token 选择及邻域定义,以适应时间、频率与通道结构。低信噪比下剪枝可能删除弱判别信号,通道差异与小数据也可能使选择策略不稳定。一个可检验的小实验是在固定 EEG 任务、数据划分及骨干下,对比稠密适配器、剪枝后稠密重建、直接稀疏卷积三种路径,同时记录任务指标与同一硬件上的端到端延迟。已有 EEG 相关工作尚未检索确认。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。