清华大学团队在 ACM MM 2026 论文中提出「视觉源幻觉」概念,指出短输出场景下多模态大模型的物体幻觉根植于视觉特征提取与图文嵌入错位,并用 AHAF 与 ACFT 方法仅以 0.9% COCO 数据、零推理开销取得 SOTA。