OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
一、文章主要内容总结
该研究聚焦于在线舆情报告自动生成这一关键领域,针对传统人工生成舆情报告耗时低效、缺乏标准化任务定义与基准数据集的问题,完成了三项核心工作:
- 任务定义:提出“自动化在线舆情报告生成(OPOR-GEN)”任务,要求模型整合新闻报道与社交媒体帖子等多源异质数据,生成包含事件标题、事件摘要、事件时间线、事件焦点、事件建议五个结构化模块的舆情报告。
- 数据集构建:创建首个事件中心型基准数据集OPOR-BENCH,涵盖2012-2025年间的463个危机事件,每个事件包含多源文档(8842篇新闻、185554条社交媒体帖子)和结构化参考摘要,覆盖自然灾害(44.9%)与人为危机(55.1%),涉及108个国家,确保地理与类型多样性。
- 评估框架设计:提出基于智能体的评估框架OPOR-EVAL,通过事实核查工具(Fact-Checker)、舆情挖掘工具(Opinion-Miner)、解决方案咨询工具(Solution-Counselor),从15个维度(5分制李克特量表)对生成报告进行评估,与人类专家判断高度相关。
- 实验验证:基于5个前沿大模型(GPT-4o、DeepSeek-R1等),对比端到端生成与模块化生成两种策略,发现模型在事实一致性、多源合成、实用推理能力上表现均衡,但存在信息过载处理不足、时间推理复杂等挑战,且不同LLM评估器存在固有评分偏差。
二、文章创新点
- 首次明确任务
