「混元图像2.0」共找到 2881 篇相关文章
Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨
2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。
从Foundation Model到Physical AI,三星「杀入」大模型核心战场
三星正快速进入大模型核心战场,构建Foundation Model体系,采购GPU用于AI基建。它提出Meki架构、M2RL训练范式和LiveClawBench评测体系,由AI Model TF团队推进,负责人是唐业辉。
国产AI视频炸了!SkyReels-V3三大功能重磅开源,1张图生成逼真视频
昆仑天工SkyworkAI团队开源多模态视频生成模型SkyReels-V3,它能在一个架构内搞定参考图像转视频、视频延长、音频驱动虚拟形象三大核心能力,超越主流商业模型,且真正开源。
中国足球还是靠机器人吧!首届机器人运动会闭幕:票价终究保守了
世界人形机器人运动会闭幕,清华火神队1-0胜德国队获机器人足球赛冠军。赛中有诸多有趣场面,且比赛背后硬核技术拉满,像足球赛用自主行动机器人,胜负关键在算法。
ICLR 2025新成果:文档检索“降本增效”,从此“开挂”
传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。
炸裂!谷歌I/O大会王者归来:Gemini“世界模型” 初现,搜索“换脑”,一句话制作原声电影
谷歌I/O 2025大会发布大量技术,虽Gemini 2.5 Ultra未到,但Pro有革新。还推出新模型、代理工具,多模态能力提升,搜索重塑,加入AI眼镜开发,倾尽全力发展AI生态。
刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude
阿里巴巴突袭发布新一代基座大模型Qwen3.8 - Max,它总参数量达2.4万亿,在多场景表现出色,在权威榜单冲进全球第一梯队,性能直逼Claude,且价格实惠,实测反馈良好。
半天16.5k Star,谷歌AI Agent强势开源,AI编程变天了!
Google推出轻量级且功能强大的开源AI Agent——Gemini CLI,能将Gemini带入用户终端,可利用Gemini 2.5 Pro编写代码等,半天获16.5k Star,还具备多种强大功能。
确认!DeepSeek多模态AI已经开测
DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。
The Batch: 886 | OpenAI 与 Meta 多元化其 AI 产品线
OpenAI和Meta此前专注聊天机器人,如今分别推出新举措。OpenAI推Sora 2、ChatGPT Pulse和Instant Checkout;Meta推出Vibes。新项目利用AI提升用户参与度与收入,探索社交视频领域和大模型与商务融合。