跳到正文

算法、任务与模态

Tokenization 最新动态

Tokenization 研究索引;按可核对的标签归档,不以热度评价质量。

27 条精选近 30 天 14 条共收录 30 条

更新

精选归档 · 第 2 页

1月1日周三第 21–27 条
  1. OpenReview · EEG75

    CodeBrain:融合解耦分词器与多尺度架构的 EEG 基础模型

    基于摘要分析。CodeBrain 针对 EEG 通道配置、序列长度和任务目标差异带来的模型迁移困难,提出结合解耦分词器与多尺度架构的 EEG 基础模型,以两阶段训练学习通用表征。 第一阶段,TFDual-Tokenizer 独立对异质的时域和频域成分进行离散编码。作者称该设计可使离散表征空间获得二次方级扩展,并通过跨域 token 分析提供一定可解释性;具体码本规模、组合方式、分词器训练目标及解释性验证尚未验证。第二阶段,EEGSSM 将结构化全局卷积与滑动窗口注意力结合,分别覆盖稀疏长程依赖和局部依赖,并以掩码自监督学习预测 TFDual-Tokenizer 产生的 token 索引。 相较全连接 Transformer,作者认为 EEGSSM 更符合脑组织的小世界拓扑,能够高效捕捉 EEG 的多尺度结构。这是作者对架构的机制解释,尚不能仅凭摘要认定其具有经验证的生物学对应关系或明确的计算效率优势。 作者报告,在 10 个公开 EEG 数据集上采用线性探测评估,实验支持 CodeBrain 的泛化能力。摘要未列出数据集名称、任务、指标、基线或数据划分,因此不能判断这些结果分别对应被试内、跨被试、跨会话还是跨数据集协议,也不能量化性能提升。需进一步核对预训练与下游评估的数据关系、通道差异处理方式,以及解耦分词器和全局—局部架构各自的贡献;实验协议、消融及统计信息尚未验证。 复现方面,摘要说明代码和预训练权重将在未来版本发布,当前材料不足以确认可用实现。复现还需核对预处理流程、掩码策略、码本设置、预训练数据组成及线性探测配置。

    阅读价值:值得关注其时域与频域解耦离散表征及全局—局部依赖建模的组合机制,但跨数据集泛化的具体协议、效率收益与拓扑解释仍需全文核对,代码和预训练权重尚待发布。

  2. OpenReview · EEG75

    CodeBrain:结合解耦 Tokenizer 与多尺度架构的 EEG 基础模型

    基于摘要分析。CodeBrain 面向通道配置、序列长度和任务目标差异导致的 EEG 模型迁移困难,提出将时频解耦 Tokenizer 与多尺度架构结合的两阶段 EEG 基础模型,以增强异质信号表征和长短程依赖建模。 第一阶段,TFDual-Tokenizer 分别对时间与频率成分进行离散化。作者称,这种解耦方式使离散表征空间获得平方级扩展,并可通过跨域 token 分析提供一定可解释性;具体码本配置、组合方式及解释性验证尚未验证。第二阶段,EEGSSM 将结构化全局卷积与滑动窗口注意力结合,用于联合建模稀疏长程依赖和局部依赖,并以掩码自监督目标预测 TFDual-Tokenizer 生成的 token 索引。摘要未给出具体损失形式、掩码策略或训练规模。 相较于全连接 Transformer,作者将 EEGSSM 的设计解释为更贴近脑网络的小世界拓扑,并更高效地捕捉 EEG 的多尺度结构。这是作者的结构动机与结论,尚不能据此认定模型已验证真实脑连接结构,或在计算开销上具有确定优势。 作者报告,在 10 个公开 EEG 数据集上采用 linear probing 评估,结果支持 CodeBrain 的泛化能力。摘要未提供数据集名称、任务、被试数量、划分方式、对照基线和指标数值,因此无法判断其证据对应被试内、跨被试、跨会话还是跨数据集泛化,也不能直接比较不同协议下的性能。 复现时需核对时频解耦与多尺度模块各自的贡献、不同通道配置和序列长度的处理方式,以及预训练与下游评估的数据关系。实验协议、消融及统计信息尚未验证。作者表示代码与预训练权重将在未来版本发布;当前材料不能确认其已公开,也不能据此归类为模型或软件发布。

    阅读价值:值得阅读其时频解耦离散表征与全局—局部依赖建模的组合机制,但作者所述泛化能力与效率优势仍需结合完整评估协议、消融及资源开销核对。

7月10日周三
  1. OpenReview · State space models78

    MambaByte:无分词的选择性状态空间模型

    基于摘要分析。MambaByte 研究直接从原始字节学习的 token-free 语言建模:去除子词分词的归纳偏置,却也使序列显著变长。其核心贡献是将 Mamba 状态空间模型(SSM)适配为在字节序列上自回归训练的语言模型,并设计结合 tokenized drafting 与 byte-level verification 的推测解码方案。 机制上,摘要将标准自回归 Transformer 随序列长度增长的有效内存需求,与 Mamba 的固定大小记忆状态和高效解码进行对比。MambaByte 利用后者应对字节级长序列;解码阶段由分词模型生成草稿,再进行字节级验证。具体状态更新、训练损失、草稿模型配置与验证规则尚未验证。 作者报告,在语言建模任务上,MambaByte 可与先进的子词 Transformer 竞争,部分比较中甚至表现更好,同时保留 token-free 模型对噪声的鲁棒性。作者报告,相对于标准 MambaByte 实现,其推测解码方案实现 2.6× 推理加速,解码效率接近子词 Mamba。摘要未提供数据集、模型规模、性能指标、硬件、批量大小及序列长度,因此这些效果与速度结论的适用范围,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,固定大小状态的序列处理机制可能缓解长时程 EEG 建模的计算与内存压力,但原任务依赖离散字节及自回归监督,并不等价于连续、多通道 EEG。可考察复用 SSM 序列模块,输入表示、通道融合与任务输出需改造;字节级验证方案不能直接照搬。低信噪比、跨被试差异、通道变化与小数据训练可能削弱收益。一个可证伪的小实验是在同一 EEG 数据划分与匹配训练预算下,对比 SSM 与 Transformer 随输入时长变化的任务性能、峰值内存及推理耗时;仅降低资源消耗不能证明解码效果改善。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其以固定大小状态处理长字节序列、并结合 tokenized drafting 与 byte-level verification 加速解码的机制,但语言建模效果与效率结论仍需核对全文实验协议。

1月1日周一
  1. OpenReview · State space models78

    MambaByte:无 token 的选择性状态空间模型

    基于摘要分析。MambaByte 研究直接从原始字节学习的无 token 语言建模,旨在避免子词分词的归纳偏置,同时缓解字节序列更长带来的计算与内存压力。其核心贡献是将 Mamba 状态空间模型(SSM)用于字节序列的自回归训练,并提出结合 tokenized drafting 与 byte-level verification 的推测解码适配方案。 机制上,摘要将标准自回归 Transformer 随序列长度增长的内存需求,与 Mamba 的固定大小记忆状态及高效解码进行对照。MambaByte 的建模单位是字节,而非子词;推测解码则用 token 化序列生成草稿,再在字节层面验证。具体状态更新、选择性机制、训练损失及草稿验证流程尚未验证。 作者报告,MambaByte 在语言建模任务上可与先进的子词 Transformer 竞争,部分表现更优,并保留无 token 模型的噪声鲁棒性优势。作者还报告,其推测解码适配方案相较标准 MambaByte 实现获得 2.6 倍推理加速,解码效率与子词 Mamba 相近。摘要未提供对应数据集、模型规模、任务指标、硬件、生成长度及对照配置,因此这些结果只能在作者所述比较范围内理解,实验协议、消融及统计信息尚未验证。 平台推测(待验证):其固定大小状态机制可能对应 EEG 长时序处理中随窗口长度增长的资源瓶颈,但字节语言建模依赖离散序列与自回归监督,不能直接等同于连续、多通道 EEG 建模。可考察 SSM 主干的复用,输入编码与训练目标需改造;tokenized drafting 的优势是否成立则取决于 EEG 是否存在合适的离散草稿表示。低信噪比、跨被试分布差异、通道变化及小数据可能削弱效果。一个可检验的小实验是在固定数据划分和参数预算下,比较 SSM 与 Transformer 在不同 EEG 窗口长度上的任务指标、峰值内存及推理延迟。上述仅为迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以固定大小状态处理长字节序列的机制,以及结合 tokenized drafting 与 byte-level verification 的推测解码方案;摘要中的语言建模与效率结论仍需结合完整实验协议核对。

10月28日周六
  1. OpenReview · Representation learning73

    自监督跨表表征学习的规模扩展实验

    基于摘要分析。该研究关注深度表格表征学习的规模扩展潜力,提出面向单表与跨表学习的 Transformer 架构,并通过自监督掩码单元格恢复进行预训练,考察模型规模与预训练设置对表征质量的影响。 核心机制是使用表特定 tokenizer 处理不同表格,并共享 Transformer 主干;训练以缺失值插补为任务,通过恢复被掩码的单元格学习表征。摘要未说明 tokenizer 如何编码列类型、表结构与单元格,也未给出掩码策略或具体损失形式。 作者报告,规模实验覆盖约 10^4 至 10^7 参数的模型,预训练数据由 76 个不同数据集组成,共包含 135 M 个训练 token。评估分别考察单表与跨表预训练设置,在整理的基准数据集上使用线性探测,并与常规基线比较。摘要未列出基准名称、划分方式、基线名称或性能指标,因此尚不能判断规模收益、跨表迁移效果及其统计可靠性;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移假设是,将 EEG 的结构化试次特征视为表格,用数据集特定 tokenizer 接入共享主干,以应对不同特征布局下的表征复用问题。可复用部分是共享主干与掩码恢复目标;需改造特征编码、通道与频带对应关系,并明确跨被试、跨会话的划分。原方法依赖表格单元格结构与较大规模预训练数据,不能直接等同于原始 EEG 时序建模;低信噪比、通道差异及小数据可能使恢复目标偏向噪声或数据集特征。可检验的小实验是在固定 Cross-subject 划分及相同训练预算下,对比单数据集与跨数据集预训练后的冻结表征线性探测,且预训练排除测试被试。相关 EEG 工作尚未检索确认。

    阅读价值:该研究以表特定 tokenizer 与共享 Transformer 主干探索跨表自监督预训练及规模效应,值得核对其线性探测对照和跨表泛化协议,但摘要未提供性能结果。

9月22日周五
  1. OpenReview · Representation learning74

    NAR-Former V2:重新审视用于通用神经网络表示学习的 Transformer

    基于摘要分析。该研究关注神经网络架构本身的表示学习,目标是在不实际训练或部署候选网络的情况下预测其属性,辅助网络设计与部署。作者提出 NAR-Former V2,以修改后的 Transformer 同时表示单元结构网络与完整网络。 方法先将网络视为图,通过 tokenizer 将其编码为序列,再将 GNN 的归纳表示学习能力引入 Transformer,以改善对未见架构的泛化;此外还提出若干面向图结构表示的修改。摘要未说明具体编码规则、归纳机制的实现、损失函数及这些修改的组成,不能据此判断其如何保留拓扑关系或处理不同规模的网络。 结果方面,作者报告:在 NNLQP 数据集的完整网络编码与延迟预测任务上,该方法明显优于 GNN 方法 NNLP;在 NASBench101 与 NASBench201 的单元结构网络准确率预测任务上,与其他先进方法取得高度可比的表现。摘要未提供具体分数、指标、划分或目标硬件条件,实验协议、消融及统计信息尚未验证。作者提供了代码链接,但代码可运行性与复现条件尚未核验。 平台推测(待验证):迁移假设是利用架构表示预测器降低 EEG 候选网络的逐一训练与部署评估成本,而非直接学习 EEG 信号。可复用部分是架构图编码与属性预测框架;需核对 tokenizer 对 EEG 常用算子的支持,并收集任务特定的架构—性能或硬件延迟标签。原方法依赖架构图及其目标属性监督,所需数据规模尚未验证。EEG 的低信噪比、被试和通道差异,以及小样本评估波动,可能使准确率标签不稳定,削弱架构层面的泛化。一个可证伪的小实验是在固定 EEG 数据划分与训练预算下,为一组候选架构采集性能标签,按架构留出测试,与 GNN 预测器比较误差及排序一致性;这属于迁移验证建议,不是论文已完成的实验。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其将 GNN 的归纳表示学习能力融入 Transformer、统一处理单元结构与完整网络的机制,但用于 EEG 网络设计的价值尚未验证。

9月20日周三
  1. OpenReview · EEG72

    BELT-2:面向多任务脑解码的 EEG—语言表征自举对齐

    BELT-2 研究如何将 EEG 表征与语言表征对齐,并连接大语言模型(LLMs)以支持多任务脑解码;核心方法结合 BPE 级对齐、多任务 EEG 编码器与 prefix-tuning。基于摘要分析,未取得论文全文。 技术机制方面,作者采用 byte pair encoding(BPE)级 EEG—语言对齐,并在 EEG 领域联合进行多任务训练与解码;随后利用 EEG 编码器的中间输出,通过 prefix-tuning 连接 LLMs。该设计将 EEG 表征学习与语言生成接口结合,但摘要未说明 EEG 与 BPE 单元的对应构造、对齐损失、多任务的具体组成、LLM 型号,以及训练时哪些模块冻结或更新,相关细节尚未验证。 结果方面,作者报告在 ZuCo 数据集上获得 BLEU-1 为 52.2% 的解码结果,但摘要未提供数据划分、被试内或跨被试协议及对照基线,因此不能据此判断跨被试泛化能力。作者还报告在其他翻译基准上提升 31%–162%,但未明确基准名称、指标、对照方法及提升的计算口径,不能将其解释为准确率或百分点提升。作者声称该方法能够从非侵入式脑信号解码连贯、可读的句子,并声称相关设计具有首次性;这些主张尚需正文与既有工作核对。 复现时需核对 EEG 预处理、EEG—文本配对方式、训练与测试划分、多任务监督来源,以及文本生成阶段是否使用额外文本条件。尤其应区分 EEG 提供的信息与 LLM 语言先验对生成质量的贡献;摘要不足以确定这一贡献分解。实验协议、消融及统计信息尚未验证。摘要称代码可通过匿名链接获取,但当前材料未给出该链接,代码可访问性与复现条件尚未验证。

    阅读价值:值得阅读的具体原因是 BELT-2 将 BPE 级 EEG—语言表征对齐、多任务训练与 LLM prefix-tuning 结合,可用于考察语言先验与 EEG 表征对文本解码的各自贡献,但其评估协议与提升幅度仍需全文核对。