跳到正文
OpenReview · Representation learning· Gabriel Poesia; Georgia Gabriela Sampaio·· 2025-09-17精选AI 评分75

利用语言模型进行程序化表征学习

Programmatic Representation Learning with Language Models

AI 导读

基于摘要分析。本文研究如何兼顾监督学习中的表征能力与预测器可解释性,提出 Learned Programmatic Representations(LeaPR):用代码表示从数据点到标量的特征函数,再将这些特征交给决策树预测,而不是直接用神经网络完成预测。 核心机制是利用 Large Language Models(LLMs)的领域先验及调用领域专用库编写代码的能力,合成特征函数。作者提出两条学习路径:一是改造 FunSearch,使搜索对象由直接生成预测器转为生成特征;二是提出 ID3 的变体,在决策树叶节点需要分裂时按需生成新特征。这将特征构造与预测器学习联系起来,且特征代码和树的预测路径可供检查;不过,可检查并不自动等于特征具有可靠的语义解释。 作者报告,在棋局局面评估、图像分类和文本分类实验中,方法得到高质量、不依赖神经网络的预测器,其表现常可与神经网络竞争。摘要未提供具体数据集、划分、指标、对照配置或数值,无法据此比较性能。这里的“不依赖神经网络”指所得预测器,不能据此推断特征学习阶段无需 LLM 或专用计算资源。实验协议、消融及统计信息尚未验证;复现还需核对 LLM 配置、特征搜索预算、代码执行环境及模型选择流程。 平台推测(待验证):迁移假设是,若 EEG 任务具有可由领域库计算的候选特征,LLM 生成标量特征与按需树分裂机制可能用于探索可检查的分类规则。可复用的是特征代码搜索和决策树学习框架,需改造的是 EEG 输入接口、通道与时间窗处理及允许调用的特征库。该路径依赖监督标签、可执行特征函数和足以评估候选特征的数据;低信噪比、跨被试差异、通道变化及小数据下的反复搜索均可能导致不稳定或过拟合。一个可检验的小实验是在固定 Cross-subject 划分下,仅用训练数据搜索特征,与预设 EEG 特征加决策树比较同一测试协议下的 Balanced Accuracy,并记录搜索成本与特征稳定性。上述 EEG 效果并非原文结果,已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是将 LLM 生成的可检查特征函数与决策树学习结合的两种机制,但其性能、可解释性及向 EEG 任务迁移的可行性仍需核对全文和实验。

来源:OpenReview · Representation learning · openreview.net