跳到正文
OpenReview · State space models· Samuel Myren; Kurtis Shuler; Grant David Meadors; Emily Taylor·· 14 天前精选AI 评分72

利用潜空间分层实现高效语言模型评估

Efficient Language Model Evaluation Using Latent-Space Stratification

AI 导读

基于摘要分析。该研究针对大型语料上 LLM 分类 Accuracy 或其他性能指标评估成本过高的问题,利用文档嵌入中的潜在结构设计两阶段抽样,在固定评估预算下提高总体性能估计的精度;其主要贡献是评估样本分配方法,而非语言模型架构改进。 方法先抽取少量随机样本,在潜空间中拟合预测模型回答是否正确的 Gaussian process classifier,再依据预测正确性曲面划分层。剩余预算按各层规模及估计变异程度,通过 Neyman-style 分配规则安排抽样,最后使用标准分层估计量估计总体性能。核心依赖是潜在表示能够提供有关 LLM 正确性的信息,而不仅是区分文档主题。 作者报告,在合成数据与真实 arXiv 文档分类任务中,当潜在表示对 LLM 正确性具有信息量时,该方法相较相同预算下的简单随机抽样可得到更低方差的估计。摘要未提供样本规模、预算、具体指标数值或方差下降幅度;实验协议、消融及统计信息尚未验证。阅读全文时需核对首阶段预算占比、分层及方差估计的稳定性,以及表示信息不足时的表现。 平台推测(待验证):该抽样机制可能用于评估成本较高的 EEG 分类系统,但原领域有效不等于 BCI 有效。假设 EEG 嵌入能预测分类错误,可复用两阶段抽样与预算分配模块,但需将文档表示替换为 EEG 表示,并明确估计对象是试次总体还是被试总体。低信噪比、跨被试与通道差异,以及小样本下错误率估计不稳定,都可能削弱收益。一个可检验的小实验是在已有完整标签的固定 EEG 测试池中,按相同评估预算重复模拟分层抽样与简单随机抽样,以全量 Accuracy 为参照比较估计误差和方差,并明确被试划分协议。已有 EEG 相关工作尚未检索确认。

阅读价值

该研究把有限预算下的 LLM 性能评估转化为模型辅助分层抽样,值得核对其在潜空间可预测模型正确性时的方差收益,以及首阶段建模成本与分层稳定性。

来源:OpenReview · State space models · openreview.net