混元图像2.0」共找到 2891 篇相关文章

算法论文8

VAE再被补刀!清华快手SVG扩散模型亮相,训练提效6200%,生成提速3500%

前脚谢赛宁宣告VAE在图像生成领域退役,后脚清华与快手可灵团队就推出无VAE潜在扩散模型SVG。它通过语义+细节双分支+分布对齐,实现多任务通用,训练提效62倍、生成提速35倍。

量子位
产品应用7

Codex 和 Claude Code,用哪个?

文章探讨 Codex 和 Claude Code 的使用,建议有条件用最好的模型工具。介绍二者特点,给出文件同步、记忆文件更新、项目目录结构添加等使用方法,还强调写好 Prompt 及明确 AI 能力边界的重要性。

AGI Hunt
新闻资讯7

Sora 2数手指翻车,奥特曼成第一批「受害者」,被AI玩成最惨打工人

Sora 2虽强大,但数手指测试翻车,模拟场景也有瑕疵。奥特曼成其首批“受害者”,AI生成视频将他玩坏。同时,OpenAI研究员对Sora应用发布存担忧,而奥特曼解释资金投入原因。

机器之心
新闻资讯7

Anthropic 联创曝内部工程师已不写代码了,但工作量翻倍!开发者嘲讽:所以 Claude bug才那么多?

Anthropic联合创始人透露公司工程师已不写代码,通过管理AI Agent系统写代码,工作量达原来2 - 3倍,还提议向AI公司征税。但开发者质疑Claude存在诸多问题,认为AI写代码未到革命地步。

AI前线
开源动态8

用 1/1000 的参数打穿大模型:我为什么强烈推荐 PaddleOCR

PaddleOCR是百度开源的OCR工具,模型参数仅0.07B,却能在复杂场景媲美大模型精度。其新一代PP - OCRv5全面升级,在文本检测等方面表现出色,还稳定增长且在海外受关注。

MacTalk
算法论文8

登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini

加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型。

新智元
新闻资讯7

Stripe x Cursor,硅谷两代“金童”对谈: 未来5年IDE里将不再是代码

本文是 Cursor CEO Michael Truell 和 Stripe CEO Patrick Collison 的深度对谈,讨论了 Stripe 的技术实践、编程的未来。如 LLM 会改变 IDE,未来编程更重需求描述;还提到 Stripe 的技术选型、API 重写计划等。

海外独角兽
新闻资讯7

Pixel 10『打样』AI手机:苹果、华为、三星差几年?

谷歌发布被称为“全球最AI的手机”Pixel 10系列,全新Tensor G5+端侧Gemini Nano带来AI领先。文章将其与苹果、华为、三星手机对比,分析各品牌AI功能优劣势,指出未来手机竞争是硬件、系统与大模型的综合较量。

鲸选AI
开源动态7

将数据优势发挥到极致:「杭州六小龙」开源搭建空间智能的第一步

大模型时代数据支撑至关重要。群核科技在首届TechDay为空间智能发布空间语言模型SpatialLM 1.5和空间生成模型SpatialGen,前者学会空间语言,后者实现场景多视角图像生成且具时空一致性,SpatialGen已开源。

机器之心
产品应用8

面壁MiniCPM-V4.5新王炸!8B手机10FPS长视频秒懂,文档手写全能识别!

面壁上新最强端侧多模态模型MiniCPM-V 4.5,基于Qwen3 - 8B与SigLIP2 - 400M构建,总参数量8B。它视觉语言理解强、手机能跑,有高帧率视频理解等特点,还有多方面技术亮点。

CourseAI