「跨具身迁移」共找到 1469 篇相关文章
从Debugger到Developer : 低代码时代新基准NoCode-bench,SWE-Bench作者力荐
浙江大学牵头联合多机构推出全新评估基准NoCode - bench,直面自然语言驱动功能添加任务,发现当前最佳LLM成功率仅两成。它构建严谨,任务挑战大,指明AI软件开发改进方向,且已开源。
打脸OpenAI!谷歌Gemini高级版获IMO 2025官方认证金牌:纯自然语言端到端推理
谷歌DeepMind宣布高级版Gemini在2025年IMO中6题解5题获金牌,经官方认证,全程用自然语言推理。对比OpenAI自我宣称拿金牌,谷歌成绩更有说服力,还介绍了Gemini进步及实现方法。
ICML 2025|多模态理解与生成最新进展:港科联合SnapResearch发布ThinkDiff,为扩散模型装上大脑
现有扩散模型缺乏多模态推理创作能力,在算力和数据不充裕时实现该功能是难题。ICML2025上,港科联合SnapResearch提出ThinkDiff,以较少资源让扩散模型有思考能力,开辟多模态理解生成新路径。
ICML2025|宁波东方理工大学刘野,陈云天:DragSolver:用于真实汽车风阻系数估计的多尺度Transformer方法
当汽车高速行驶,空气阻力影响车辆性能。传统风阻系数测算方法耗时久,难以满足实际需求。宁波东方理工大学等机构研究者提出DragSolver模型,能快速准确估计风阻系数,经实验验证效果优,有降本增效等价值。
750城市+5000小时第一人称视频,上海AI Lab开源面向世界探索高质量视频数据集
上海人工智能实验室等机构联合推出持续迭代的高质量视频数据集项目Sekai,含Sekai-Real和Sekai-Game两个数据集,还训练了模型Yume。它特点突出,团队按四环节构建,望成世界建模等领域的数据基石。
Gemini负责人爆料!多模态统一token表示,视觉至关重要
Gemini模型行为产品负责人Ani Baddepudi与谷歌AI Studio产品负责人探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。
“多模态方法无法实现AGI”
文章指出一些人认为多模态方法能实现AGI,但作者觉得此策略会失败。真正的AGI要理解物理世界,而LLMs只是记忆规则。此外,规模最大化方法用于AGI有数据稀缺问题,多模态建模也存在诸多问题。
重磅!鸿蒙平台首个全跨端APP ——腾讯视频ovCompose框架发布
腾讯视频团队推出跨平台开发框架ovCompose,弥补Compose Multiplatform不足。还推出KuiklyBase,涵盖多项鸿蒙适配等建设。该框架有高性能、支持混排等优势,已开源,未来将持续优化。
360开源高质量图文对齐数据集!收纳1200万张图像+1000万组细粒度负样本,让模型告别“图文不符”
360人工智能研究团队的冷大炜博士团队开源FineHARD高质量图文对齐数据集,包含1200万张图像、4000万个边界框及对应描述、1000万组细粒度难负样本,能提升模型图文对齐能力,还介绍了构建方法、分析及应用前景。
太顺手啦,这款开源框架让AI助手秒级接入应用,狂揽20.5K星!再见繁琐AI开发
CopilotKit是基于React的开源框架,开发者能以极简代码将智能助手集成到Web应用。它有三分钟集成、场景感知等优势,具备五大核心功能,适用于多场景,三步即可入门,比同类项目更有优势。