按来源浏览

资讯库

Runway 公布实时视频生成研究:边描述提示词边流式生成

Runway 公布实时视频生成研究,用户可在描述提示词的同时流式生成视频,而非输入提示后等待成品。该方案基于其首个 General World Model GWM-1(构建于 Gen-4.5 之上,逐帧生成,支持镜头运动、机器人指令或音频控制),通过用自身输出训练模型来抑制误差累积。

AI 辅助古文理解:可视化与音画同步的桃花源记

该项目利用 ChatGPT 4 的图像生成能力,将经典文学作品《桃花源记》转化为互动式可视化图谱,并结合央视著名播音员李立宏的高品质朗诵,旨在帮助学生更好地理解与记忆古文内容。

作者上线表情包动图生成工具

作者发布自制表情包工具,上传角色图片即可一键生成动图表情,每天提供 300 次共用免费额度。

同一个 MiniMax,世界各有用法

MiniMax 以六个全球合作案例展示其模型在公共技能培训、IP 授权创作、垂直模型后训练、小语种继续预训练、芯片推理优化与云平台分发等方向的落地,并借此招募全球化人才。

ChatGPT Images 2.5 发布

ChatGPT 发布了 Images 2.5 版本,主打更快的生成速度、更高的图像保真度和基于评论的编辑功能。

OpenAI 新进展:图像编辑升级 & 千禧年难题

OpenAI 推出 ChatGPT Images 2.5 提升生成速度与编辑精度,并公布对 Navier‑Stokes 千禧年难题的构造性解法,展示 AI 在图像和高阶数学领域的最新突破。

GPT Image 2.5 与 2.0 效果对比

作者提供了一个对比仓库,展示了在相同提示词下 GPT Image 2.5 与 2.0 版本的生成效果差异。

GPT Image 2.5 提示词与图像编辑完全指南导读

作者发布 GPT Image 2.5 提示词与图像编辑完全指南,主张 AI 图像生成正从文生图技巧转向局部编辑、多图合成、角色一致性与工程交付的工作流,并拆解官方指南的 8 大心法与 22 个命名工作流。

Qwen Cloud 梗图创作大赛亮点

Meme Fest 亮点来了:蒙娜丽莎开始说唱,一片菠菜叶长出了脸,一只狗在亲戚上门时假装刷手机……创作者的脑洞没有上限。

OpenAI 发布 ChatGPT Images 2.5 图像模型

OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升。

亚马逊 Prime Video 上线新 AI 功能:不同语言配音都能准确对口型

IT之家 9 月 10 日消息,当地时间 9 日,亚马逊通过新闻稿宣布 Prime Video 上线 AI 口型同步功能,可以让 演员的嘴部动作与“真人配音”音轨对齐 。目前,该功能仅支持德国剧集《贵族高中:我们之间的鸿沟》的英语配音版,未来还将扩展至更多作品