知识卡片:SDARE-Bench:评估大语言模型在双人与群体对话中的污名检测与回应
英文标题:SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue
英文关键词:原文未提供独立关键词;基于内容可归纳为 LLM safety; stigma detection; response generation; dyadic dialogue; group dialogue; conversational benchmark
原始来源:https://arxiv.org/abs/2609.01548v1
一句话结论
SDARE-Bench 是论文作者所称的首个基于场景的、同时评估大语言模型在对话中进行“污名检测”和“开放式回应生成”的基准。基于 8 个大语言模型的实验结果显示,模型在群体对话中对污名成分的识别普遍较差;在构造的群体压力情境中,污名表达率平均达到 97.5%,提示污名回应是大语言模型安全性中反复出现的一个漏洞。
事件概述或研究问题
- 大语言模型越来越多地被用于建议寻求和决策场景,可能影响社会判断与偏见传播。
- 污名对个人和社区有深远影响,但针对污名的基准仍然稀缺。
- 已有通用评估多依赖静态提示和固定格式任务,忽略了真实对话中的上下文和“受众效应”。
- 本基准的研究问题是:在双人对话与群体对话中,大语言模型能否识别污名成分?模型生成的开放式回应是会抵制污名,还是可能强化污名?群体压力和社交复杂度是否会改变模型行为?
方法/产品要点
- 提出 SDARE-Bench,一个基于场景的基准,包含两类任务:污名检测和开放式回应生成。
- 数据规模包括 1,138 个双人查询和 1,388 个群体对话(具体计量单位待核实)。
- 在 8 个大语言模型上进行了实证评估。
- 开放式回应使用一个在 1,392 条人工标注回应上训练得到的分类器进行评价。
- 此外还构造了群体压力情境,用于观察模型面对压力时的污名表达变化。
主要结果或产业意义
- 8 个模型在识别污名成分方面普遍表现不佳,尤其是在群体对话中。
- 与双人情境相比,模型在群体情境中生成的开放回应表现出:
- 污名表达显著增加;
- 对污名的抵抗力更弱;
- 给出的建议更加不切实际。
- 在构造的群体压力设置中,污名表达率平均达到 97.5%。
- 从产业意义看,模型在社交复杂场景中的安全表现不能仅靠静态内容审核来保证,部署在群体对话、社区支持或公共决策等场景前,需要针对污名和群体压力做专门评估。
为什么重要
- 与已有相关卡片相比,本条增量信息主要体现在:FriendBench 关注双人熟悉度推断,Grip on LLMs 关注荷兰政府场景中的价值观评估,而 SDARE-Bench 首次将“污名”作为对话中的检测与回应对象,并且覆盖双人对话和群体对话两种社交情境。
- 结果说明,传统安全测试可能遗漏一类关键风险:模型在“社交围观”或群体压力下,更有可能表达或顺应力污名内容。
- 这为后续大语言模型安全对齐、对话评估和偏见缓解研究提供了新的方向:不仅要看模型知道什么,还要看它在复杂人际动态中会说什么。
局限与不确定性
- 目前仅基于 arXiv 页面提供的摘要元数据,原文正文未能抓取;以下信息待核实:
- 8 个大语言模型的具体名称、参数量与版本;
- 1,388 个群体对话中的对话人数、轮次和结构;
- 1,138 个双人查询的具体任务设计;
- 分类器的构建过程、验证指标和潜在偏差;
- 1,392 条人工标注回应的标注者构成;
- 97.5% 这一数字的计算口径、分母与置信区间;
- 该基准是否经过同行评审,以及与其他安全基准的对比情况。
可用于图书/PPT/简报的角度
- 用“97.5%”作为分析抓手:在该基准的群体压力设置下,几乎所有被测模型都出现了某种形式的污名表达,这比双人情境更值得警惕。
- 讨论“会话情境如何改变模型底线”:从单轮问答扩展至多轮、多方对话时,模型的价值判断和语言行为会发生系统性漂移。
- 引入“受众效应”概念:模型面对不同人数、不同社会压力的对话时,其回应策略可能不同。
- 提示“污名”议题不仅涉及内容过滤,还涉及模型是否具备抵抗污名、提供现实支持性建议的能力。
原始材料
- 英文标题:SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue
- 英文关键词:原文未提供独立关键词列表;基于摘要可提炼为 LLM safety; stigma detection; response generation; group dialogue; dyadic dialogue。
- 原始来源:https://arxiv.org/abs/2609.01548v1
- 备注:原文正文未能抓取;以上知识卡片内容均基于该 arXiv 页面给出的摘要元数据生成,无法确认的信息已标注“待核实”。