跳到正文

算法、任务与模态

Supervised 最新动态

Supervised 研究索引;按可核对的标签归档,不以热度评价质量。

64 条精选近 30 天 53 条共收录 82 条

更新

精选归档 · 第 4 页

1月1日周一第 61–64 条
  1. OpenReview · State space models71

    TrackSSM:基于状态空间模型的通用运动预测器

    基于摘要分析。TrackSSM 针对多目标跟踪(MOT)中运动模型难以兼顾效率与跨场景有效性的问题,提出基于数据依赖状态空间模型(SSM)的统一编码器—解码器框架,利用历史轨迹预测目标边界框的时间位置,为轨迹关联提供位置信息。 核心模块 Flow-SSM 以历史轨迹的位置及运动信息引导边界框的时间状态转移。运动编码器使用 Mamba-Block 编码历史轨迹,flow decoder 则通过级联的 Flow-SSM 运动解码模块,利用编码后的 flow 信息完成位置预测。训练采用 Step-by-Step Linear(S²L)策略:在目标前一帧与当前帧的位置之间进行线性插值,构造逐步线性训练的伪标签,以引导边界框的时间转移。这里的 flow 是轨迹运动信息,摘要不足以将其等同于图像光流。 作者报告 TrackSSM 适用于多种跟踪场景,并在多个基准上取得良好跟踪表现,但摘要未列出基准名称、数据划分、对照方法、具体指标或计算成本,因此无法核对性能提升幅度及效率收益。摘要声明代码和模型已公开;实现细节、实验协议、消融及统计信息尚未验证,也不能据此推断论文接收或发表状态。 平台推测(待验证):假设以历史信息调节状态转移的机制能够适应 EEG 的时变动态,可将其作为 EEG 时序预测的候选模块。原方法依赖可定位的目标轨迹及相邻帧位置监督;EEG 没有直接对应的边界框,需要改造输入表示、预测输出和监督目标,而 Mamba 编码器与条件化状态转移思路可能复用。低信噪比、通道差异、跨被试非平稳性及小数据训练都可能使运动建模收益无法迁移;线性插值还可能平滑掉真实的快速变化。一个可证伪的小实验是在固定 EEG 数据划分和相同训练预算下,比较 Mamba 基线与加入历史信息引导状态转移的模型在短时序预测中的误差,再单独核对插值监督是否带来收益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以历史位置和运动信息引导数据依赖状态转移、并用插值伪标签训练运动解码器的机制;摘要未给出定量结果,其优势及向 EEG 时序建模迁移的可行性尚未验证。

  2. OpenReview · EEG73

    从 EEG 脑记录中学习鲁棒的深度视觉表征

    基于摘要分析。该研究面向从 EEG 解码视觉信息的问题,提出两阶段方法:先从 EEG 提取特征、学习鲁棒的深度视觉表征,再将所得表征用于图像生成和分类。其贡献包括对特征提取流程泛化能力的评估,以及将未见图像映射至 EEG 空间并近似重建的框架。 方法方面,摘要提及使用深度学习架构,分别结合监督学习与对比学习,在三个数据集上验证特征提取流程,并开展零样本 EEG 分类。具体网络结构、对比学习目标、两阶段训练衔接及零样本任务的类别划分尚未验证;多个数据集上的评估也不能直接视为 Cross-dataset 迁移实验。 作者报告,仅用 EEG 的单模态学习获得了被试不变、线性可分的视觉表征,其 k-means Accuracy 优于 EEG 与图像的联合表征学习。该结论的被试划分、线性可分性检验、聚类标签匹配方式和比较数值未在摘要中展开,是否采用严格 Cross-subject 评估尚未验证。 图像生成方面,作者报告其 EEG 图像合成方法在 EEGCVPR40 和 Thoughtviz 上的 Inception Score 分别提升 62.9% 和 36.13%,并声称优于 GAN 相关的现有最佳表现。这些数字为相对提升而非百分点;具体对照方法、原始分数、数据划分及统计信息尚未验证。摘要所述“未见图像映射至 EEG 空间再重建”还需与实际 EEG 输入的图像重建协议区分,不能仅凭摘要确认其对未见视觉类别的脑信号解码能力。 复现时应优先核对 EEG 预处理、被试与刺激划分、监督信息的使用、单模态与联合学习的对照条件,以及生成指标的计算协议。全文、实验消融及代码可用性尚未验证。

    阅读价值:值得核对其仅用 EEG 学习视觉表征与 EEG—图像联合表征的对照,以及零样本分类和图像生成的评估协议,以判断表征可分性与跨被试泛化是否同时成立。

9月23日周六
  1. OpenReview · Representation learning76

    用于鲁棒表征学习的上下文视觉 Transformer

    基于摘要分析。研究针对不同群组间潜在因素变化导致的图像分布偏移,提出 Contextual Vision Transformers(ContextViT),通过群组上下文条件化图像表征,并在推理时适应新的测试分布。 核心机制借鉴 in-context learning:将与输入图像属于同一群组的图像信息映射为额外的 context token,再将其附加到输入图像 tokens 中,使表征随群组上下文调整。作者另引入 context inference network,从某一群组的一批样本即时预测 context token。该机制依赖可用的群组归属及同组样本;摘要未说明群组的具体定义、上下文聚合方式、训练损失或测试时是否更新模型参数,因此不能将其直接等同于参数更新式测试时自适应。 作者报告,在监督微调设置下,为预训练 ViTs 加入上下文条件化机制,在 iWildCam 和 FMoW 上持续改善分布外泛化;在自监督表征学习设置下,ContextViT 在 Camelyon17 病理图像及 JUMP-CP 显微图像基准上,比对应 ViT 获得更稳定的分布偏移下图像表征。摘要未给出指标数值、数据划分或效应大小,实验协议、消融及统计信息尚未验证。复现时需核对群组构造、上下文批次采样、预训练条件与基线配置。 平台推测(待验证):迁移假设是,EEG 的被试或会话可作为群组,上下文条件化可能帮助处理跨被试或跨会话分布变化。可复用 context token 与上下文推断思路,但需将图像 token 编码改为 EEG 时序或时空编码,并明确测试群组可用样本及监督条件。低信噪比、小批次、通道配置差异,以及同组任务类别比例变化,都可能使上下文混入噪声或任务内容。一个可检验的小实验是在固定 Cross-subject 划分下,以同一 EEG 编码器比较无上下文与同组上下文条件化,并加入打乱群组的对照;严格固定测试上下文采样规则,检验增益是否来自有效群组信息。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其由同组样本推断 context token 的机制及测试时分组协议:这为利用群组上下文处理分布偏移提供了具体方法,但其对 EEG 跨被试或跨会话表征的价值尚未验证。

9月22日周五
  1. OpenReview · Representation learning81

    表征学习的最小描述长度与泛化保证

    基于摘要分析。本文研究监督表征学习如何从训练样本泛化至未见数据,提出信息论式可压缩性框架,以标签或潜变量(表征)的最小描述长度(Minimum Description Length,MDL)推导泛化误差上界,并引入数据依赖先验以部分利用理论结果。 核心机制:不同于 Information Bottleneck(IB)通常使用输入与表征之间的 Shannon 互信息,该框架的界涉及训练集和测试集表征或标签的分布相对于固定先验的“multi-letter”相对熵。作者指出,输入—表征互信息不足以刻画算法的泛化能力,并报告新界能够反映编码器结构,对确定性算法也并非空泛。方法以 Blum-Langford 的 PAC-MDL 界为基础,加入分块编码与有损压缩,其中有损压缩使几何可压缩性成为其特例。作者称这些界据其所知是针对 IB 类型编码器及表征学习的首类结果;该优先性尚未独立核实。 结果与验证边界:作者报告,数值模拟显示恰当选择的数据依赖先验相较于 IB 中使用的经典先验具有优势。摘要未提供数据集、划分、具体指标或数值,因而不能判断优势规模,也不能将理论泛化界等同于实测预测性能。界的假设、先验构造所需数据、压缩失真条件、实验协议、消融及统计信息尚未验证。 平台推测(待验证):其机制可能为小样本 EEG 监督表征的复杂度控制提供分析工具,但原领域理论不等于 BCI 有效性。可复用的是 MDL、压缩和先验设计的分析框架;需改造的是 EEG 表征编码、失真定义,以及对被试、会话和通道结构的处理。低信噪比下压缩可能保留噪声或丢失判别信息,跨被试分布变化也可能限制界的解释力。一个可检验的小实验是假设在固定编码器和明确的 Cross-subject 划分下,仅以训练被试构造先验,对比经典先验与数据依赖先验,检验所得界是否非空泛、是否对应未见被试的泛化误差变化;实施前需核对定理适用条件。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以分块编码和有损压缩构建的 MDL 泛化界,尤其是对编码器结构及确定性算法的处理;界的适用条件、紧致性和数据依赖先验的实验收益尚需全文核对。