跳到正文
OpenReview · State space models·· 2025-05-20AI 评分68

面向小样本对话状态跟踪的生成空间偏好优化

Generation Space Preference Optimization for Few Shot Dialogue State Tracking

AI 导读

基于摘要分析。本文研究任务型对话系统中的小样本 Dialogue State Tracking(DST,对话状态跟踪),针对标注数据有限时训练不充分的问题,提出 Generation Space Preference Optimization(GSPO),将偏好优化用于 DST,并复用已有监督微调数据构造偏好数据。 核心机制:摘要称,GSPO 利用模型的生成空间及监督微调(SFT)数据生成偏好数据,不依赖额外奖励模型或额外偏好数据。其阅读价值在于探索有限标注条件下如何从既有数据中获得进一步训练信号。但生成候选的方式、偏好判定规则、优化目标及训练流程尚未验证,不能将其直接等同于某一种既有偏好优化算法。 结果:作者报告,该方法相较使用 100B 量级 LLM 的方法具有竞争力,并在使用超过完整训练数据 5% 的条件下表现更好;摘要同时括注“400 个训练样本”,其与比例条件的具体对应关系需核对全文。摘要未提供数据集、评价指标、具体分数、数据划分及对照配置,因此目前不能量化优势或判断不同模型规模下的比较公平性。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务已有生成式输出模型,并能依据已有标注可靠判定候选输出的优劣,复用监督数据构造偏好对可能具有方法参考价值;这不等于普通 EEG 分类可直接采用 GSPO。可复用的是偏好数据构造思路,需改造候选生成、任务输出及偏好判定模块。低信噪比、跨被试与通道差异、小数据可能使偏好标签不稳定。一个可证伪的小实验是在固定跨被试划分与相同标注预算下,对比仅 SFT 和增加偏好训练的生成式 EEG 模型,并核对收益是否稳定。相关 EEG 工作尚未检索确认。

来源:OpenReview · State space models · openreview.net