肉眼看不出的幻觉?清华提出视觉源幻觉,仅用 0.9%数据实现 SOTA
清华大学团队在 ACM MM 2026 论文中提出「视觉源幻觉」概念,指出短输出场景下多模态大模型的物体幻觉根植于视觉特征提取与图文嵌入错位,并用 AHAF 与 ACFT 方法仅以 0.9% COCO 数据、零推理开销取得 SOTA。
按来源浏览
清华大学团队在 ACM MM 2026 论文中提出「视觉源幻觉」概念,指出短输出场景下多模态大模型的物体幻觉根植于视觉特征提取与图文嵌入错位,并用 AHAF 与 ACFT 方法仅以 0.9% COCO 数据、零推理开销取得 SOTA。
Runway 公布实时视频生成研究,用户可在描述提示词的同时流式生成视频,而非输入提示后等待成品。该方案基于其首个 General World Model GWM-1(构建于 Gen-4.5 之上,逐帧生成,支持镜头运动、机器人指令或音频控制),通过用自身输出训练模型来抑制误差累积。
该项目利用 ChatGPT 4 的图像生成能力,将经典文学作品《桃花源记》转化为互动式可视化图谱,并结合央视著名播音员李立宏的高品质朗诵,旨在帮助学生更好地理解与记忆古文内容。
作者发布自制表情包工具,上传角色图片即可一键生成动图表情,每天提供 300 次共用免费额度。
剪映推出具备 Agent 智能剪辑功能的 AI 助手及创作 Hub,支持批量混剪、视频扩写和自定义技能,旨在打通从创意到发布的视频制作全流程。
LlamaIndex 推出 ParseBench,对 100 种文档解析方法进行严格评测,发现 LlamaParse 系列在准确性和成本效率上领先,而图表抽取是普遍瓶颈,视觉语言模型在图像定位方面表现不佳。
MiniMax 以六个全球合作案例展示其模型在公共技能培训、IP 授权创作、垂直模型后训练、小语种继续预训练、芯片推理优化与云平台分发等方向的落地,并借此招募全球化人才。
阿里发布 Qwen3.8-Omni-Flash 音视频多模态模型,具备 1M 上下文及工具调用能力,大幅减少 Token 消耗,仅提供 API。
ChatGPT 发布了 Images 2.5 版本,主打更快的生成速度、更高的图像保真度和基于评论的编辑功能。
SkyProduction(天工工作台)联合昆仑万维推出 MiniMax H3 模型限免活动,9 月 9 日会员可免费无限使用,9 月 10-14 日新开会员或充值积分可获赠限免天数,活动旨在降低短剧、漫剧等创作者的试错成本。
花叔用 800 字故事让视频 Agent「够搭」自动拆成 17 场戏、生成设定图和视频片段,拼出 5 分钟成片,并验证了成片后局部修改不推倒重来的能力,认为 AI 视频创作进入更可控的「单反级交付时代」。
OpenAI 推出 ChatGPT Images 2.5 提升生成速度与编辑精度,并公布对 Navier‑Stokes 千禧年难题的构造性解法,展示 AI 在图像和高阶数学领域的最新突破。
作者提供了一个对比仓库,展示了在相同提示词下 GPT Image 2.5 与 2.0 版本的生成效果差异。
作者发布 GPT Image 2.5 提示词与图像编辑完全指南,主张 AI 图像生成正从文生图技巧转向局部编辑、多图合成、角色一致性与工程交付的工作流,并拆解官方指南的 8 大心法与 22 个命名工作流。
腾讯开源 WeVisDoc,支持直接将文档图片转换为 Markdown 格式,并能完整保留复杂的结构、公式与表格。
标题、出处和时间是判断一条消息是否值得继续读的第一道门槛。把这三件事看清楚,比先追情绪更省时间。
OpenAI 推出 API 新图像模型 GPT-Image-2.5 Flare 和 Sunburst,主要改进包括更锐利的细节、更强的风格遵循,以及更多对图像编辑的控制。
Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。
Runway 发布 Runway Plugins,面板可直接嵌入 Premiere Pro 和 After Effects,无需导出导入即可在时间线内生成图像和视频、重渲染片段并一键放置结果。
Meme Fest 亮点来了:蒙娜丽莎开始说唱,一片菠菜叶长出了脸,一只狗在亲戚上门时假装刷手机……创作者的脑洞没有上限。
OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升。
DeepSeek 正式发布 V4.1 Flash,全新 Causal-Encoder-Decoder 结构的 552B 参数 MoE 模型,输入激活 8B、输出激活 16B,具备原生多模态视觉理解,基准测试超越包括 DeepSeek V4 Pro 在内的旗舰模型。
IT之家 9 月 10 日消息,当地时间 9 日,亚马逊通过新闻稿宣布 Prime Video 上线 AI 口型同步功能,可以让 演员的嘴部动作与“真人配音”音轨对齐 。目前,该功能仅支持德国剧集《贵族高中:我们之间的鸿沟》的英语配音版,未来还将扩展至更多作品
IT之家 9 月 10 日消息,深度求索今日正式发布 DeepSeek V4.1 Flash 模型 。这是其全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。 新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型