DeepSeek-V4.1-Flash 发布
DeepSeek-V4.1-Flash 发布 今天,我们正式发布 DeepSeek-V4.1-Flash 模型。这是我们全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型
按来源浏览
DeepSeek-V4.1-Flash 发布 今天,我们正式发布 DeepSeek-V4.1-Flash 模型。这是我们全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型
DeepSeek-V4-Flash-Vision-Exp 发布 今天,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,这是一个实验性质的模型,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型
作者评论剪映终于推出 AI 助手与创作 Hub,认为字节此前在该市场动作迟缓。
Qwen-Image-2.1 7B 开源图像模型,支持 RGBA 透明图层生成与编辑,多图输入推理加速,适用场景覆盖真实质感与文字排版要求。
剪映发布 CapCut Hub,实现 AI 视频生成与剪辑无缝衔接,PC 端提供一站式创作环境,手机端提供智能提效功能。
作者拆解 Qwen-Image-2.1 这个 7B 生成+编辑+透明通道三合一开源图像模型,梳理其四大能力与单流 DiT、块因果注意力、RGBA 自编码器等关键架构设计。
Qwen 宣布 Qwen-Image-2.1 现已支持 ComfyUI,权重开放。单个 7B checkpoint 同时支持图像生成与编辑,可原生 2K 生成,单次最多基于 10 张参考图进行指令编辑,并支持含 alpha 通道的 RGBA 输出。
OpenAI 发布 ChatGPT Images 2.5 图像模型 — 点击查看完整日报
Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本 — 点击查看完整日报
Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像 — 点击查看完整日报
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。
通义千问发布 Qwen-Image-2.1,一个 7B 参数的原生图像生成与编辑模型,生成和编辑共用单一检查点,最多支持 10 张参考图
SGLang-Diffusion 发布对 Qwen-Image 2.1 的 Day-0 支持,覆盖文本生成图像、多图编辑和透明 RGBA 输出,单 checkpoint 即可完成。
阿里云 Qwen 团队发布 Qwen-Image-2.1 图像生成模型并开放权重,定位为 Qwen-Image 系列中最均衡、高性价比的版本,统一支持生成与编辑。
通义千问开源 Qwen-Image-2.1:7B 参数实现文生图与图像编辑一体化 AIbase基地 发布于 AI新闻资讯 · 1 分钟阅读 · Sep 21, 2026 25 9月21日,通义千问团队正式开源新一代图像模型 Qwen-Image-2.1
阿里 70 亿参数图像模型Qwen-Image-2. 1 开源发布,号称以瘦身之躯叫板闭源巨头 · 1 · Sep 21, 2026 9 阿里通义千问团队近日端出了一道让开源社区眼前一亮的菜:开放权重的图像生成与编辑模型Qwen-Image-2.1正式登场
StepFun 发布旗舰级多模态 MoE 模型 Step 5 Preview,并提供多重免费试用入口,可累计获得 75 天 Plus 版本订阅。
OpenRouter 梳理其目录中的 DeepSeek V4 系列图像输入支持情况:V4.1 Flash 原生读图(2026年9月10日上线,$0.15/$0.60 每百万 token)。
语言不通造成的影视剧观看违和感即将成为历史。当地时间9月9日,亚马逊通过新闻稿正式宣布,旗下流媒体平台Prime Video全面上线全新的AI口型同步功能。该技术能够巧妙地将演员的嘴部动作与真人配音的音轨进行精准对齐,彻底解决过去跨语言配音时画面与声音脱节的痛点。作为该功能的全球首发落地项目,目前这项技术率先支持德国热
深度求索今日正式发布了全新模型结构系列中的最小尺寸成员——DeepSeek V4.1Flash。作为一款具备原生多模态视觉理解能力的轻量化模型,其设计初衷旨在实现更高的能力上限、更快的推理速度、更大的吞吐量,并具备向更大参数模型扩展的潜力。在核心架构方面,DeepSeek V4.1Flash 采用了552B 参数的 M
AI 音乐生成平台 Suno 正式推出全新一代模型家族——Suno v6。这是 Suno 迄今为止最大的升级,也是其与华纳音乐集团(Warner Music Group)、BMG 及 Believe 等音乐产业合作伙伴共同开发的首个模型系列。官方称,v6模型更快、更富表现力、音质更高,并赋予创作者前所未有的精准控制力。
据《案件聚焦》节目公众号,近日上海市浦东新区人民法院宣判了上海市首例涉 AI 声音仿冒不正当竞争纠纷案。米哈游公司于 2025 年发现,一款 AI 变声软件提供了《原神》63 款角色的声音资源包,供用户付费变声使用,同时该软件还大量使用《原神》角色图片。米哈游随后将这款软件的运营公司告上法庭,称被告提供的变声服务会让用
IT之家 9 月 20 日消息,阿里千问今日宣布,开源千问图像系列当前兼顾生成效果、推理效率与使用成本的开源图像模型 Qwen-Image-2.1。 Qwen-Image-2.1 将文生图与图像编辑整合在同一模型中,视觉生成部分仅有 7B 参数,并原生支持透明图像的生成与编辑
阿里 Qwen 团队发布开源权重图像生成与编辑模型 Qwen-Image-2.1,视觉生成部分仅 7B 参数,团队称在其自建基准上超过多数闭源模型,独立基准尚待验证,可在 RTX 3090 等消费级 GPU 上运行。
一个限时小游戏让玩家在 60 秒内判断图片是真实照片还是 AI 生成,每张图有 10 秒作答时间。游戏在计时开始前会先加载首批图片,考验用户凭直觉识别 AI 图像的能力。
Qwen 开源 Qwen-Image-2.1,在单一模型中统一文生图与图像编辑,视觉生成组件仅 7B 参数,并原生支持透明图像的生成与编辑。模型支持最多 10 张参考图、圆圈涂画和独立掩码指定局部编辑,通过混合粒度注意力与 KV cache 复用提升推理效率,并改进了文字排版、人像光照和人物产品一致性。
Claude 没有图像生成器,这是涉及知识工作的智能体项目中的一大缺口。它很擅长用代码来绘制或建模物体,但 Google 和 OpenAI 的图像生成器为其 AI 提供了更多选项,可用于制作 PowerPoint、模型图、信息图等。
Qwen-Image-2.1 已在 Hugging Face 上线
阿里 Qwen 团队发布并开源 Qwen-Image-2.1,一个 7B 的图像生成与编辑统一模型。官方称其推理速度大幅加快,可原生生成和编辑 RGBA 透明图层,支持最多 10 张参考图和精准局部编辑,覆盖全景图、信息图和虚拟试穿等场景。
通义千问发布 Qwen-Image-2.1,定位为 Qwen-Image 系列中均衡且高性价比的图像生成模型,现已开放权重。该模型为生成与编辑一体化的 7B 轻量架构,原生支持生成和编辑 RGBA 透明图层,编辑支持最多 10 张参考图和精确局部控制,并擅长全景图、信息图和虚拟试穿等场景。