知识卡片:针对危险驾驶情绪反应的视觉语言助手
一句话结论
Keep Yelling Assistant (KYA) 通过结合视觉感知(YOLOv8)与情感自适应的大语言模型,实时检测危险驾驶行为并生成符合用户偏好的情绪化语音反馈(如中性、幽默、分析性),在用户研究中最高评分达 4.29/5.00(YOLOv8s + ChatGPT-4o 组合)。
事件概述或研究问题
现有自动驾驶/辅助驾驶中的视觉语言模型虽已具备感知和推理能力,但几乎不考虑情绪维度或真实用户体验。本研究旨在填补这一空白,开发一个能实时检测高风险驾驶行为(如突然切入)并生成具有情绪表达力、可适配驾驶员偏好的语音反馈系统。
方法/产品要点
- 系统名称:Keep Yelling Assistant (KYA)
- 视觉模块:基于 YOLOv8 变体检测周围车辆,提取并归一化关键驾驶指标(相对距离、速度、预计到达时间),输出结构化行为日志。
- 语言模块:用户可设定情绪风格(中性、幽默、分析性),将行为日志输入大语言模型(ChatGPT-4o、Claude 3、Gemini 2.5、Copilot)生成口头反应。
- 评估方式:使用行车记录仪拍摄的危险驾驶视频 + 108 位参与者进行用户研究;参与者选择偏好风格,并评估大语言模型的情绪对齐程度。
主要结果或产业意义
- 所有大语言模型均获得积极评分,但不同用户画像的偏好存在差异。
- YOLOv8s + ChatGPT-4o 组合获得最高评分 4.29/5.00。
- KYA 展示了车载人工智能在安全、信任度和情感福祉方面的新可能性,适用于传统车辆和自动驾驶车辆。
为什么重要
这是首个将实时感知与情绪自适应对话整合进车载系统的公开研究,提出了“情绪智能”的车内人工智能新范式。相比于现有只关注感知或决策的辅助系统,KYA 更关注驾驶员的主观体验与情绪支持,可能提升驾驶安全与人际信任。
局限与不确定性
- 评估仅基于 108 名参与者的用户研究以及预先录制的 dashcam 视频,实际动态驾驶环境中的表现(如延迟、噪音、多语言支持等)待核实。
- 情绪风格的“幽默”是否在所有文化/语境中恰当仍需验证。
- 大语言模型的推理开销与实时性要求能否满足车载硬件条件尚未明确。
可用于图书/PPT/简报的角度
- 情绪化人机交互:如何让机器“懂”人的情绪并做出恰当反馈,提升用户体验。
- 车载 AI 的下一站:从“只看路”到“既看路又照顾人”。
- 对比分析:比较不同 LLM(ChatGPT-4o vs. Claude 3 vs. Gemini 2.5)在情绪对齐任务上的表现差异。
原始材料
- 英文标题:Vision-Language Assistant for Emotional Reactions to Risky Driving
- 英文关键词:vision-language model, emotional intelligence, risky driving, autonomous driving, human-AI interaction
- 来源:arXiv preprint arXiv:2607.16181v1 (2026-07-17)
- 作者:Harine Choi, Eun Hak Lee, Zhengzhong Tu
- URL:https://arxiv.org/abs/2607.16181v1