「多模态推理模型」共找到 8445 篇相关文章
一张图生成任意场景3D模型,部分遮挡也不怕|IDEA x 光影焕像联合开源
IDEA研究院张磊团队与香港科技大学谭平团队联合推出SceneMaker框架,以DINO - X与Triverse为基础,实现从任意开放世界图像到带Mesh的3D场景完整重建,解决遮挡难题,有多项创新,应用场景广泛。
AI Agent如何重构企业核心系统?深度拆解Agent、多模态与组织变革的实战路径|AICon
12月19 - 20日北京举办的AICon大会,围绕AI Agent等展开探索。来自腾讯等企业的人士将分享构建智能系统经验。大会有Keynote、平行技术专场、晚场辩论等,涵盖多领域议题,为参会者带来前瞻思想盛宴。
“神级模型”Gemini 3.0实力刷屏!联手谷歌全新氛围编程工具重塑前端,如今只差官宣
谷歌发布“vibe coding”版AI Studio,产品形态向可视化构建转变。有迹象显示Gemini 3.0将发布,二者结合或重塑前端开发。AI Studio速度快、易用,Gemini 3.0在前端开发测试中表现出色,谷歌借此参与AI竞赛。
网络基础设施如何支撑大模型应用?北京大学刘古月课题组5大方向研究,相关论文入选ACM SIGCOMM 2025
在智能计算和网络演进背景下,北大刘古月课题组聚焦网络研究。其 5 篇论文入选 ACM SIGCOMM 2025,从架构、数据、运维、安全四个维度形成技术闭环,推动新一代网络系统发展。
关于现代GPU体系结构内存一致性(Memory Consistency)模型的一些猜想(二)——同步性能
文章聚焦GPU应用层面,通过实验对比不同同步代码实现的性能。在H20 GPU上测试,发现scope越小同步性能越好,内存屏障开销随scope增大而增加,还介绍非PTX及官方推荐实现方式并给出性能对比。
马斯克发布“地球最强AI模型”Grok 4:横扫所有榜单,在“人类最终测试”超越人类博士”!
北京时间7月10日,马斯克团队发布Grok 4,其基准测试成绩惊人,在‘人类最终测试’等表现出色。它成功源于多智能体协作、追求真相哲学和高算力投入,还在多领域展现应用潜力,同时公布定价并坦言短板。
速递|前字节Seed强化学习专家孙鹏加入星尘智能,将大模型后训练经验带到物理世界
9月2日消息,前字节跳动Seed团队强化学习专家孙鹏博士加入星尘智能,负责机器人强化学习方向。星尘智能有技术、资本和商业优势,孙鹏经验丰富,此次加入将助力其强化学习后训练发展。
ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集
来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。
基础模型又一关键拼图,腾讯混元发布训练新范式「无相」:引入功能性记忆,打破静态权重枷锁
腾讯混元团队发布HY - WU范式,打破静态权重束缚,引入功能性记忆,实时生成个性化参数。应用于图形编辑基模效果好,在图像编辑任务表现优秀,还对未来AI架构提出多方面展望。
LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!
文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。