OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents
Yulin Hu, Zimo Long et al.
· 2026
OP-Bench benchmarks over-personalization using Irrelevance, Repetition, and Sycophancy across 1,700 long-horizon queries built from LoCoMo, then analyzes memory systems like RAG, LDAgent, Mem0, MemU, and MEMOS. Self-ReCheck, a lightweight memory filter, improves average OP-Bench scores by 29% for Qwen3-8B while preserving personalization on LoCoMo compared to BASE.