a tall building lit up at night

微软亚洲研究院

ACL + ICML 上新 | 下一代AI如何理解不同文化、尊重不同价值观?

已发布

本期内容速览:

1.基于人格提示的大语言模型能否模拟文化子群体价值观偏好?

2.CAReDiO:基于代表性与差异性的大语言模型文化对齐数据优化方法

3.DisAlign:解耦共识与价值表征,实现大模型可控多元价值观对齐

4.基于价值观编码表的大模型文化价值观对齐分布式开放评测

5.MMA-ASIA:面向原生文化感知的多语言多模态文化对齐评测框架

6.PICACO:基于总相关性优化的多元上下文价值观对齐

1.基于人格提示的大语言模型能否模拟文化子群体价值观偏好?

paper title

论文链接:https://arxiv.org/abs/2604.12851 (opens in new tab)

现有大语言模型价值观对齐多采用单一、以西方视角为主的统一价值观标准,忽视了多元社会内部不同文化子群体的差异、甚至冲突的观念,易造成模型对部分群体输出不适配、带有偏见的内容。为解决这一问题,研究员们以多元种族宗教并存的新加坡为研究场景,依托世界价值观调查第七批数据 (World Value Survey),构建了包含2万余样本的子群体价值观数据集,提出模态多样性得分(MDS)用于量化群体间的价值共识与冲突程度,并设计了面向未见过的交叉人口组合的泛化评估框架。

diagram
图1:实验框架概述。(A)先利用模态多样性评分构建社会价值观景观图。(B–C)基于结构化偏好对模型进行微调,以验证:i)对未见过的交叉属性特征(如年龄×宗教)的组合泛化能力;ii)向开放式生成任务的迁移性能。(D)虽然SFT在分布外(OOD)子群体上实现了显著的准确率提升,但(E)分析显示其性能仍明显偏向主流人口群体。

实验显示,未微调基线中,GPT-4.1等主流大模型对子群体模态偏好的预测准确率仅57.4%;在结构化数据上做简单监督微调后,分布外子群体的预测准确率平均提升17.4%,归一化平均绝对误差降低0.096,部分对齐能力可迁移至开放式生成任务。然而,模型存在显著的预训练偏差,对年轻、男性、华裔、基督教背景的价值观模拟效果更好;微调虽然提升了整体预测准确率,但会拉大各子群体在距离感知指标(NMAE)上的性能差距,暴露出平均指标掩盖公平性的风险。

这一结果表明,基于结构化数据的轻量微调可实现细粒度的子群体价值观对齐,但需将公平性纳入核心考量,避免放大社会固有偏见,为构建文化敏感、群体公平的智能系统提供了实证依据。

2. CAReDiO:基于代表性与差异性的大语言模型文化对齐数据优化方法

paper title

论文链接:https://arxiv.org/abs/2504.08820 (opens in new tab)

大语言模型跨文化部署时,普遍存在以西方视角为主的固有文化偏差,而专用于文化对齐的训练数据存在两大短板:要么难以抓取本土群体共识、文化代表性不足,要么无法区分不同文化间独有特质、差异性不足,对齐效果受限。

为此,研究员们提出了CAReDiO数据优化框架,基于文化共识理论设计了信息增益目标以筛选具有文化代表性的问答案例,根据认知冲突理论设计了文化散度目标以增强样本在目标文化上的独特性,并采用基于上下文学习的迭代方案交替优化问题、回答,自动生成兼具代表性与差异性的文化数据集CARDSet,数据集覆盖全球15种文化。

diagram
图2:CAReDiO框架包含两个基于信息论的目标模块(分别用于提升代表性与独特性),以及一个迭代方案以交替优化问题与回答。

多模型微调与多基准测评表明,CAReDiO产出的数据承载更丰富、更有代表性的本土文化信息,跨文化聚类区分效果更强;仅200条训练样本即可完成高效文化对齐,在选择题与开放式生成任务中均稳定优于已有的文化对齐数据集。针对中日韩这类文化相近区域,该框架能有效拉开群体价值观的边界、降低模型文化混淆。母语人工评测结果也证实,基于CARDSet微调的模型输出更贴合本地人群真实的价值观念。CAReDiO为低成本、细粒度的多元文化大模型对齐提供了可扩展的标准化数据构建方案。

3.DisAlign:解耦共识与价值表征,实现大模型可控多元价值观对齐

paper title

论文链接:https://openreview.net/pdf?id=0xiTAhvLj6 (opens in new tab)

在传统大语言模型多元化价值观对齐时,常因价值维度天然耦合,导致在调整某一项价值观偏好的同时连带干扰其余价值目标与基础能力,难以实现精细可控的多元价值观对齐。而现有模型融合方法大多未考虑这种内在纠缠,导致精细化价值对齐失败。

针对这一问题,研究员们提出了DisAlign多元化价值观对齐框架,从信息几何的角度将多种价值观表征拆解为共识与独特性两部分:先通过乘积式专家模型构建共识点,再对专家残差表征做广义特征值谱分解,提取低秩的价值观共识子空间和独特价值观子空间,实现多价值观的独立调控。该方法无需重复训练,仅通过参数线性组合即可适配任意用户指定的价值观权重组合。

diagram
图3:(A)单轮对话中存在多个值表达式。(B)由于数据混合,会出现参数耦合现象。(C) DisAlign框架求解共识子空间与唯一值子空间的示意图。

在道德基础、日常困境、价值棱镜三类数据集上的实验显示,DisAlign在多维度、随机维度、全维度价值观对齐任务中准确率均超现有最优基线。针对关怀、忠诚等对立冲突价值观可平滑切换调控。

消融实验证实,共识子空间主要保留模型通用能力与共识价值部分,价值观独特子空间则精准承载不同价值的差异性偏好。二者结合后,可实现模型数学、代码等基础能力基本无损耗的多元化对齐。该方法为大模型在安全合规前提下适配多元用户价值观偏好提供了可解释、可控制的技术路径。

4.基于价值观编码表的大模型文化价值观对齐分布式开放评测

paper title

论文链接:https://arxiv.org/abs/2604.06210 (opens in new tab)

伴随着大语言模型的全球部署,文化价值观对齐是模型安全与用户体验的核心保障,但现有评测体系普遍存在“效度 – 构成- 语境”三重挑战:依赖选择题的评测范式仅能检验表层文化知识,无法还原模型真实的价值观倾向,易受问卷选项、社会期望偏差干扰;依靠平均分的分数聚合方式则忽略同一文化内部不同子群体的价值观异构性;评测场景以封闭式问答为主,与真实开放式生成场景脱节。

对此,研究员们提出了基于价值观编码表的分布式开放评测框架DOVE。该框架从美、中、日、韩四国收集了1.5万余篇真实人类撰写的长文本,通过结合有损压缩的变分优化自动构建紧凑的价值观编码表,将文本映射至结构化的价值观空间,过滤无关的语义噪声。然后,框架对测试分数采用非平衡最优传输指标进行聚合,以有效量化人类与模型生成文本的价值观的分布级别差异,保留文化内部的分布结构特征。

diagram
图4:DOVE框架。该框架包含两个核心组件:i)有损压缩变分优化方法(左),用于从大规模信息丰富的文档语料库中自动构建紧凑的价值观编码表;ii)最优传输度量指标(右),用于比较人类与大语言模型价值观在分布级别的散度,从而应对C3挑战。

在12款主流大模型的实验中,DOVE展现出优异的评测效度,与下游文化相关任务的相关性达31.56%,表现显著优于传统问卷、选择题类基准;单文化仅需500条评测样本,即可维持稳定的评测信度。消融实验证实,价值观编码表与非平衡最优传输度量分别贡献了核心效度增益,前者可有效剥离非价值语义干扰,后者能精准捕捉文化内部分布结构。

该方法突破了传统评测的范式局限,为构建文化敏感的智能系统提供了标准化、可解释的评测工具,也为跨文化视角下的大模型价值观对齐研究奠定了方法论基础。

5.MMA-ASIA:面向原生文化感知的多语言多模态文化对齐评测框架

paper title

论文链接:https://arxiv.org/abs/2510.08608 (opens in new tab)

多语言多模态大模型已在全球范围内广泛应用,但在一些低资源文化场景下的理解与推理能力仍显不足。现有文化评测数据集普遍存在跨模态对齐不足、低资源亚洲语言覆盖缺失、易产生选择题捷径学习干扰等问题,难以真实反映模型的文化认知水平。

为此,研究员们构建了覆盖8个亚洲国家、10种语言的MMA-ASIA评测框架,包含27,000道由本地专家人工标注的多选题,其中79%以上的题目是需要结合文化背景的多步推理。该基准首次完成文本、图像视觉问答、语音三类输入的语义对齐,支持统一条件下的跨模态能力对比。

MMA-ASIA框架提出了五维评测体系,涵盖跨文化认知差异、跨语言一致性、跨模态一致性、文化知识泛化性与依据有效性,同时搭载文化依据验证模块,可精准识别模型捷径学习行为。

diagram
图5:MMA-ASIA评估框架概述:数据创建管道、代表性数据集样本和评估维度。

研究基于15款主流多模态大模型完成了全维度评测,实验结果显示:模型在低资源亚洲语种上的准确率相较英文大幅下滑,跨模态一致性普遍弱于纯文本任务;各类模型中5%–20%的正确作答并非依托真实文化推理,而是依靠捷径学习。

进一步分析发现,视觉问答中存在“提示引导的选择性注意力偏差”,模型易忽略关键文化视觉线索;图像token会导致推理幻觉,但研究员们提出的视觉消融前缀重放方法可消除38%的相关错误。实验也同时证实口音可作为有效的文化先验,小幅提升语音问答效果,不过,多步文化的推理任务普遍存在知识整合瓶颈。

6.PICACO:基于总相关性优化的多元上下文价值观对齐

paper title

论文链接:https://arxiv.org/abs/2507.16679 (opens in new tab)

人类价值观天然多元且常存在冲突,比如既要响应效率又要规避风险、既想追求创新刺激又需尊重传统规范。现有大模型对齐方法在多值共存场景下表现受限:单条提示难以让模型同时兼顾多个目标,容易出现偏重某类价值观、忽略其余要求的“指令瓶颈”(Instruction Bottleneck),而传统的微调方案又依赖大量标注数据与算力,成本高昂且灵活性不足。

对此,研究员们提出了无需微调的通用多元上下文价值观对齐框架PICACO。该框架依托总相关性这一信息论基础设计核心目标:最大化给定价值观集合与模型输出的条件依赖性,在迭代过程中同步提升模型对全部价值观的贴合度,并过滤无关冗余信息,规避表层虚假对齐,自动生成适配各类开源或闭源大模型的优化提示词。

diagram
图6:PICACO算法的工作流程。

PICACO算法主要交替执行以下两个步骤:1)在响应增强阶段,PICACO使用当前最优元指令e_{t-1}采样回复,并根据qω 和 qϕ 更新对齐的回复池与正则化回复池;2)在指令优化阶段,PICACO在给定当前回复池{y_i,j_t}_{M_j=1}^1和{ yˆi i,j_t}{M_j=1}^2的情况下,寻找能使TCe最大化的元指令。

经过在5组涵盖实用无害、儒家伦理、现代自由主义等共18项价值观的测试集上验证,该方法在GPT-3.5、LLaMA-3、Gemini等多类模型上均稳定优于现有基线,最多可同时平衡8项差异显著的价值准则,且在越狱攻击、分布外任务场景下仍保持鲁棒性。对比人工编写提示和传统迭代优化的基线,PICACO可有效解决表层虚假对齐缺陷,使模型输出不再机械堆砌价值关键词,而是在具体场景中自然兼顾多重诉求,为低成本、轻量化、高灵活度的大模型价值观对齐提供全新可行方案。

相关论文与出版物