「4D世界模型」共找到 8635 篇相关文章
三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!
快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,在20+基准屠榜。在多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。
别再只关注KV Cache了! LLM稀疏性新洞察:为何模型越深越稀疏?UNCOMP从矩阵熵给出答案
团队论文UNCOMP获EMNLP 2025主会接收,它提出高效推理框架,从截断矩阵熵视角解释LLM深层稀疏现象。还能识别关键结构、找到最优压缩策略,设计的UNCOMP框架优化KV Cache,实验效果佳。
RL 将如何提高具身大模型 VLA 泛化性?清华大学团队NeurIPS 2025文章分析 RL 与 SFT 泛化性差异
清华大学团队在NeurIPS 2025发表文章,揭示强化学习(RL)提升具身大模型VLA泛化能力的优势,对比其与SFT差异,还提出评测基准和训练方法,为VLA训练提供新方向。
DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测
文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。
华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元
华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现超 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单超亿元,进入规模化金融场景验证阶段。
62岁软件教父Martin Fowler警告:AI泡沫下,裁员潮印证行业萧条,大模型正将编程拖入“非确定性深渊”!
62岁软件教父Martin Fowler在The Pragmatic Engineer节目中谈AI对软件开发的影响。他认为当下行业萧条,AI有泡沫,编程从确定性转向非确定性带来挑战,也催生新工作流程,还强调测试、重构等的重要性。
GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026
本文聚焦基于模型的离线强化学习,指出RAMBO算法存在保守性难控和训练不稳问题。为此提出ROMI方法,引入鲁棒价值感知框架与隐式可微自适应加权机制,在多基准任务上超越基线算法。
驭浪而行,产业向新:2025世界人工智能大会智能体论坛前瞻,共探AI产业变革|甲子光年
2025年7月28日9点,在世界人工智能大会期间,“驭浪而行 产业向新——智能体驱动产业变革论坛”将在上海世博中心举行。论坛由多方联合主办,通过三大版块探讨AI智能体产业落地痛点,有领导致辞、院士报告等多个看点。
ICLR 2026!代码优化不再靠玄学:大模型真正学会“又快又准”,效率提升71.06%,加速比达6.08x
ICLR 2026顶会文章提出全新大模型代码优化方案,切入代码优化核心难题。该方案将代码优化率提至71.06%,加速比达6.08x,正确性提至74.54%,有很强工程可用性。
Gemini 3.5深夜登场,谷歌CEO劈柴亲自算账:速度快4倍、一年还省超10亿美元,曝内部已被颠覆
北京时间5月20日凌晨,谷歌I/O开发者大会开幕。谷歌CEO展示惊人数据,发布Gemini 3.5、Gemini Omni等新品。Gemini 3.5速度快、成本低,改变谷歌内部工作方式;Omni可生成视频;还为Gemini应用和搜索框带来升级。