最新更新

2026-09-20

你能分辨出哪些图片是AI生成的吗?

一个限时小游戏让玩家在 60 秒内判断图片是真实照片还是 AI 生成,每张图有 10 秒作答时间。游戏在计时开始前会先加载首批图片,考验用户凭直觉识别 AI 图像的能力。

AIHOT 最近七天图像生成
2026-09-20

Claude 缺图像生成器的短板

Claude 没有图像生成器,这是涉及知识工作的智能体项目中的一大缺口。它很擅长用代码来绘制或建模物体,但 Google 和 OpenAI 的图像生成器为其 AI 提供了更多选项,可用于制作 PowerPoint、模型图、信息图等。

AIHOT 最近七天图像生成
2026-09-20

Qwen 开源 Qwen-Image-2.1:7B 视觉生成组件统一图像生成与编辑

Qwen 开源 Qwen-Image-2.1,在单一模型中统一文生图与图像编辑,视觉生成组件仅 7B 参数,并原生支持透明图像的生成与编辑。模型支持最多 10 张参考图、圆圈涂画和独立掩码指定局部编辑,通过混合粒度注意力与 KV cache 复用提升推理效率,并改进了文字排版、人像光照和人物产品一致性。

AIHOT 最近七天图像生成
2026-09-20

Qwen-Image-2.1 开源:7B 图像生成与编辑模型

阿里 Qwen 团队发布并开源 Qwen-Image-2.1,一个 7B 的图像生成与编辑统一模型。官方称其推理速度大幅加快,可原生生成和编辑 RGBA 透明图层,支持最多 10 张参考图和精准局部编辑,覆盖全景图、信息图和虚拟试穿等场景。

AIHOT 最近七天图像生成
2026-09-20

Qwen-Image-2.1 已支持 ComfyUI,开源权重开放下载

Qwen 宣布 Qwen-Image-2.1 现已支持 ComfyUI,权重开放。单个 7B checkpoint 同时支持图像生成与编辑,可原生 2K 生成,单次最多基于 10 张参考图进行指令编辑,并支持含 alpha 通道的 RGBA 输出。

AIHOT 授权白名单全文图像生成
2026-09-20

通义千问发布 Qwen-Image-2.1,vLLM-Omni 提供首日支持

通义千问发布 Qwen-Image-2.1,vLLM-Omni 提供 day-0 支持。该模型可在一个模型内完成图像生成、编辑和透明图像输出,由 7.1B DiT 搭配 Qwen3-VL-8B 组成,设置和受支持的组合见 https://recipes.vllm.ai/Qwen/Qwen-Image-2.1。

AIHOT 最近七天图像生成
2026-09-20

通义千问发布 Qwen-Image-2.1 并开放权重

通义千问发布 Qwen-Image-2.1,定位为 Qwen-Image 系列中均衡且高性价比的图像生成模型,现已开放权重。该模型为生成与编辑一体化的 7B 轻量架构,原生支持生成和编辑 RGBA 透明图层,编辑支持最多 10 张参考图和精确局部控制,并擅长全景图、信息图和虚拟试穿等场景。

AIHOT 最近七天图像生成
2026-09-20

Runway 公布实时视频生成研究:边描述提示词边流式生成

Runway 公布实时视频生成研究,用户可在描述提示词的同时流式生成视频,而非输入提示后等待成品。该方案基于其首个 General World Model GWM-1(构建于 Gen-4.5 之上,逐帧生成,支持镜头运动、机器人指令或音频控制),通过用自身输出训练模型来抑制误差累积。

AIHOT 最近七天视频创作
2026-09-20

AI 辅助古文理解:可视化与音画同步的桃花源记

该项目利用 ChatGPT 4 的图像生成能力,将经典文学作品《桃花源记》转化为互动式可视化图谱,并结合央视著名播音员李立宏的高品质朗诵,旨在帮助学生更好地理解与记忆古文内容。

BestBlogs 中文 AI图像生成
2026-09-20

作者上线表情包动图生成工具

作者发布自制表情包工具,上传角色图片即可一键生成动图表情,每天提供 300 次共用免费额度。

BestBlogs 中文 AI图像生成
2026-09-20

同一个 MiniMax,世界各有用法

MiniMax 以六个全球合作案例展示其模型在公共技能培训、IP 授权创作、垂直模型后训练、小语种继续预训练、芯片推理优化与云平台分发等方向的落地,并借此招募全球化人才。

BestBlogs 中文 AI版权与规范
2026-09-19

开源端到端文档解析模型 WeVisDoc

腾讯开源 WeVisDoc,支持直接将文档图片转换为 Markdown 格式,并能完整保留复杂的结构、公式与表格。

BestBlogs 中文 AI图像生成