全模态生成」共找到 3894 篇相关文章

新闻资讯7

GPT-5系列咋都爱说「哥布林」?原因找到了

OpenAI发布博客解释模型迷上「哥布林」的原因。原来是训练“Nerdy”人格时,奖励信号偏爱怪物词汇,强化学习将风格固化并扩散到普通对话。此前DeepSeek V3.1也出现过「极」字Bug。

机器之心
新闻资讯8

OpenAI 硬件负责人的闭门分享:硬件的「终点」依旧是智能手机

OpenAI 硬件负责人 Richard Ho 认为真正的限制是整个系统,继续依赖 NVIDIA 硬件路径,无法把模型推到下一个量级,因此 OpenAI 要重新拿回 AI 运行的底层控制权。他指出手机不是为 agent 设计的,未来是云边结合,现有手机系统难满足 AI 时代需求。

Founder Park
开源动态7

一个CLAUDE.md霸榜GitHub第一!蒸馏自Karpathy,6万码农抄作业

一个名为CLAUDE.md的Markdown配置文件冲爆GitHub,本周新增44,465颗星,总星数61.6k,连续三天Trending日榜第一。它源自Karpathy对LLM编程陷阱的观察,含四条规矩,能约束AI编程Agent。

新智元
算法论文8

分享2篇最新Harness论文,一篇谷歌,一篇微软

在LLM Agent迅速发展的当下,如何为其设计合适的Harness成关键问题。本文分享微软M⋆和谷歌AutoHarness两篇论文,分别从记忆系统和动作约束维度提出自动化的Harness进化方法,并介绍了实验结果。

PaperAgent
新闻资讯7

字节Seedance 2.0发论文了,171人署名,吴永辉曾妍在列

现象级AI视频技术字节Seedance 2.0在arXiv发论文,公布26页Benchmark和170位贡献者名单。此时它正通过Byteplus平台铺向球,支持多模态输入。该模型突破瓶颈,评测表现优异,团队近半换血。

量子位
新闻资讯8

斯坦福2026 AI指数报告!中美差距已实质性抹平

斯坦福HAI发布2026年度人工智能指数报告,显示中美在顶级大模型性能上差距已实质性抹平。报告还呈现了AI能力进化、算力格局、智能边界、安监管、人才流动等多方面情况。

AIGC开放社区
产品应用8

谷歌机器人大脑又进化了。成功率飙3倍,还能看表干活、保护自己

Google DeepMind发布机器人大脑Gemini Robotics ER 1.6模型,提升机器人空间感知、多视角解析与仪表读取准度,具精准指认、读表能力,还提高操作安性与合规度,开发者可通过Gemini API等使用。

AIGC开放社区
开源动态8

重磅开源!240亿参数力压Nano Banana 2

4月初,京东探索研究院开源JoyAI - Image - Edit图像模型。它是业内首个将「空间智能」写进底层的开源一体化图像模型,能让模型「理解空间,编辑空间」,在电商和具身智能场景极具价值。

新智元
算法论文8

USC团队发布HumDex:攻克人形机器人数据瓶颈,低成本实现身灵巧操控

南加州大学团队提出HumDex系统,结合高精度便携追踪、手部控制算法和人类数据预训练机制,打破人形机器人高质量数据采集瓶颈,提升尺寸操作泛化能力,经实验验证效果显著。

机器之心
算法论文7

The Batch:927|极速扩散学习

研究表明扩散图像生成器学习重建预训练编码器嵌入可加快训练,Apple团队提出的FAE,通过缩小嵌入再重建解决了因嵌入尺寸大导致的训练受阻问题,性能与先进模型相当且训练更快。

DeeplearningAI