按来源浏览

资讯库

DeepSeek-V4.1-Flash 发布 ​

DeepSeek-V4.1-Flash 发布 ​ 今天,我们正式发布 DeepSeek-V4.1-Flash 模型。这是我们全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型

DeepSeek-V4-Flash-Vision-Exp 发布 ​

DeepSeek-V4-Flash-Vision-Exp 发布 ​ 今天,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,这是一个实验性质的模型,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型

Qwen-Image-2.1 已支持 ComfyUI,开源权重开放下载

Qwen 宣布 Qwen-Image-2.1 现已支持 ComfyUI,权重开放。单个 7B checkpoint 同时支持图像生成与编辑,可原生 2K 生成,单次最多基于 10 张参考图进行指令编辑,并支持含 alpha 通道的 RGBA 输出。

告别配音“对不上嘴”!亚马逊Prime Video重磅上线AI口型同步技术

语言不通造成的影视剧观看违和感即将成为历史。当地时间9月9日,亚马逊通过新闻稿正式宣布,旗下流媒体平台Prime Video全面上线全新的AI口型同步功能。该技术能够巧妙地将演员的嘴部动作与真人配音的音轨进行精准对齐,彻底解决过去跨语言配音时画面与声音脱节的痛点。作为该功能的全球首发落地项目,目前这项技术率先支持德国热

DeepSeek V4.1 Flash发布:原生多模态视觉理解全面超越Pro版

深度求索今日正式发布了全新模型结构系列中的最小尺寸成员——DeepSeek V4.1Flash。作为一款具备原生多模态视觉理解能力的轻量化模型,其设计初衷旨在实现更高的能力上限、更快的推理速度、更大的吞吐量,并具备向更大参数模型扩展的潜力。在核心架构方面,DeepSeek V4.1Flash 采用了552B 参数的 M

​Suno v6 正式上线:图片、视频、语音备忘录一键变音乐,精准编辑歌曲成现实

AI 音乐生成平台 Suno 正式推出全新一代模型家族——Suno v6。这是 Suno 迄今为止最大的升级,也是其与华纳音乐集团(Warner Music Group)、BMG 及 Believe 等音乐产业合作伙伴共同开发的首个模型系列。官方称,v6模型更快、更富表现力、音质更高,并赋予创作者前所未有的精准控制力。

米哈游《原神》角色声音被“偷”获赔 75 万:上海首例 AI 声音仿冒案宣判

据《案件聚焦》节目公众号,近日上海市浦东新区人民法院宣判了上海市首例涉 AI 声音仿冒不正当竞争纠纷案。米哈游公司于 2025 年发现,一款 AI 变声软件提供了《原神》63 款角色的声音资源包,供用户付费变声使用,同时该软件还大量使用《原神》角色图片。米哈游随后将这款软件的运营公司告上法庭,称被告提供的变声服务会让用

你能分辨出哪些图片是AI生成的吗?

一个限时小游戏让玩家在 60 秒内判断图片是真实照片还是 AI 生成,每张图有 10 秒作答时间。游戏在计时开始前会先加载首批图片,考验用户凭直觉识别 AI 图像的能力。

Qwen 开源 Qwen-Image-2.1:7B 视觉生成组件统一图像生成与编辑

Qwen 开源 Qwen-Image-2.1,在单一模型中统一文生图与图像编辑,视觉生成组件仅 7B 参数,并原生支持透明图像的生成与编辑。模型支持最多 10 张参考图、圆圈涂画和独立掩码指定局部编辑,通过混合粒度注意力与 KV cache 复用提升推理效率,并改进了文字排版、人像光照和人物产品一致性。

Claude 缺图像生成器的短板

Claude 没有图像生成器,这是涉及知识工作的智能体项目中的一大缺口。它很擅长用代码来绘制或建模物体,但 Google 和 OpenAI 的图像生成器为其 AI 提供了更多选项,可用于制作 PowerPoint、模型图、信息图等。

Qwen-Image-2.1 开源:7B 图像生成与编辑模型

阿里 Qwen 团队发布并开源 Qwen-Image-2.1,一个 7B 的图像生成与编辑统一模型。官方称其推理速度大幅加快,可原生生成和编辑 RGBA 透明图层,支持最多 10 张参考图和精准局部编辑,覆盖全景图、信息图和虚拟试穿等场景。

通义千问发布 Qwen-Image-2.1 并开放权重

通义千问发布 Qwen-Image-2.1,定位为 Qwen-Image 系列中均衡且高性价比的图像生成模型,现已开放权重。该模型为生成与编辑一体化的 7B 轻量架构,原生支持生成和编辑 RGBA 透明图层,编辑支持最多 10 张参考图和精确局部控制,并擅长全景图、信息图和虚拟试穿等场景。