跳到正文
OpenReview · Representation learning· Guanyu Lin; Tao Feng; Jiaxuan You·· 2025-06-22AI 评分67

因果信息指导的统一语义与 ID 表示学习

Causally-Informed Unified Semantic and ID Representation Learning

AI 导读

基于摘要分析。研究针对大规模在线广告推荐中曝光有限、数据稀疏及冷启动条件下的物品表示问题,提出融合语义 token 与 ID token 的统一表示学习框架,并结合分层相似度机制与因果学习原则,以改善物品区分能力和泛化能力。 核心机制:ID token 作为物品特有信息的锚点,语义 token 编码可共享、可迁移的属性。作者认为,单独依赖 ID 表示容易产生冗余且冷启动泛化较差,而语义表示也可能存在重复与收益不稳定。框架在早期层使用余弦相似度,以缓解嵌入过度平滑;在最终层使用欧氏距离,以增强物品区分。摘要还提出通过因果学习解耦用户曝光偏差,但因果变量、识别假设、具体损失与训练流程尚未验证。 结果与复现:作者报告,在三个基准数据集上,相较作者所称的 SOTA 基线取得 6%–17% 的性能提升,并将 token 词表规模缩减超过 80%。摘要未明确数据集名称、评价指标、提升是相对比例还是百分点、数据划分及词表缩减的对照条件,因此这些数字不能直接解释为 Accuracy 提升或模型参数缩减。摘要提供了代码地址,但代码可用性、实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,将共享语义与个体特有信息分开建模,可能有助于处理 EEG 的跨被试差异。原方法依赖用户—物品交互、物品 ID、语义属性及曝光过程;EEG 中没有直接等价的曝光机制,需要重新定义数据结构、监督信号与偏差来源。可考虑复用双类表示和分层相似度思想,但被试 ID 不应直接替代物品 ID。低信噪比、通道不一致与小样本可能使共享语义不稳定,或使 ID 表示记忆被试而损害泛化。一个可证伪的小实验是在固定 Cross-subject 划分下,对比共享表示、共享加被试特有表示及加入分层相似度的版本,检查收益是否稳定出现在未见被试上;已有相关 EEG 工作尚未检索确认。

来源:OpenReview · Representation learning · openreview.net