图像计算」共找到 1111 篇相关文章

算法论文8

相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作

S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。

量子位
开源动态8

不看后悔!GitHub 开源 MultiTalk .8k star 强大的人语音+图像绑定项目

MultiTalk 是 MeiGen‑AI 开发的开源框架,可从音频、图片和提示语生成多人对话视频。它解决传统视频制作痛点,功能亮点多,技术优势明显,应用场景广,与同类项目对比表现突出。

小华同学ai
新闻资讯8

semianalysis 长文 | 关于Meta 砸钱、抢人、领导力、建帐篷、计算、数据和超级智能

Meta在基础模型性能落后,扎克伯格亲自挂帅开启AI军备竞赛。他砸钱收购、挖人、堆算力,建GPU集群,还面临Llama 4失败问题,试图通过一系列举措追赶超级智能。

AGI Hunt
新闻资讯8

半世纪计算机理论僵局被打破!MIT科学家偶然发现:少量内存节省大量计算时间

MIT科学家威廉姆斯偶然发现,证明内存比大家认为的更强大,少量的内存与大量的时间一样有价值。他证明存在数学程序,可将算法转换成占用更少空间的形式,成果获好评。

量子位
算法论文8

DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!

4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。

花叔
产品应用8

刚刚,“云计算一哥”版龙虾发布,奥特曼打着官司也要云站台

亚马逊云科技发布Amazon Quick,可连接本地文件等,打通生态,还是主动的Agent。奥特曼虽打官司仍云站台,OpenAI与亚马逊云深度合作。此外,Amazon Connect扩展成四个AI解决方案,发布会强调Agent是新企业操作系统。

量子位
新闻资讯7

Meta详细阐述基于LLM级训练、混合并行计算与知识迁移的GEM广告模型

Meta发布生成式广告模型GEM详细信息,旨在改善平台广告推荐能力。它处理海量用户 - 广告交互数据,用三种方法构建系统,还实施GPU级优化,采用两种知识迁移策略,获业内人士认可。

AI前线
算法论文8

只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max

现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。

机器之心
新闻资讯8

太空算力竞赛白热化:谷歌刚刚发布计划,中国太空计算卫星星座已在轨运行半年

当地球AI算力竞赛内卷,太空算力赛道开启。中国国星宇航“星算”计划首批卫星半年前已组网运行,规模和算力世界第一。谷歌等巨头也有布局,但谷歌计划2027年初才发原型卫星,中国企业已占先发优势。

AI寒武纪
产品应用7

Google 推出了免费 Vibe Coding 工具,一键集成聊天、视频、图像AI,真的很氛围。

谷歌推出免费 Vibe Coding 工具,集成多种 AI 功能。谷歌 AI Studio 的 Built 模式更新,能混合匹配 AI 功能,自动连接模型和 API。用户无需了解 API 文档,可快速做出 MVP,谷歌 AI API 免费(限速)。

AI进修生