「空间智能大模型」共找到 9750 篇相关文章
视频生成不再「断片」:OneStory给模型装上「选择性记忆」,跨镜头讲故事人物场景始终如一丨CVPR'26
多镜头视频生成挑战大,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,为多镜头视频生成建立跨镜头记忆机制,可生成连贯长视频,在复杂叙事中保持一致。
“神级模型”Gemini 3.0实力刷屏!联手谷歌全新氛围编程工具重塑前端,如今只差官宣
谷歌发布“vibe coding”版AI Studio,产品形态向可视化构建转变。有迹象显示Gemini 3.0将发布,二者结合或重塑前端开发。AI Studio速度快、易用,Gemini 3.0在前端开发测试中表现出色,谷歌借此参与AI竞赛。
10个Agent一键组队:并行智能体协作,端到端交付从24h缩减到4h!
过去写代码靠程序员手动输入,即便有Copilot等工具,仍需人主导。并行代理出现后,程序员可调用多个AI并行工作,将端到端交付时间从24h缩减到4h,思维方式也需转变,对工程师能力要求也有变化。
关于现代GPU体系结构内存一致性(Memory Consistency)模型的一些猜想(二)——同步性能
文章聚焦GPU应用层面,通过实验对比不同同步代码实现的性能。在H20 GPU上测试,发现scope越小同步性能越好,内存屏障开销随scope增大而增加,还介绍非PTX及官方推荐实现方式并给出性能对比。
链式思维是幻象吗?从数据分布视角重新审视大模型推理,马斯克回复,Grok破防
亚利桑那州立大学研究发现,思维链(CoT)推理可能只是对训练数据分布内模式的复现,输入与训练数据分布有差异时,推理链条会失效。研究探究了CoT泛化性等问题,对实际应用提出警示。
Proactor AI:首个自主行动的AI 智能体,无需唤醒,就能主动识别对面是个骗子
Proactor AI v1.0发布,号称是世界首个「自主行动」的AI队友。它能感知、思考并自主行动,如识别骗局。还提供主动式AI服务,应用场景广泛,用户反响热烈,带来人机交互范式转变。
搜索智能体RAG落地不佳?UIUC开源s3,仅需2.4k样本,训练快效果好
当前 Agentic RAG 落地有挑战,UIUC 和 Amazon 提出 s3 训练范式。它仅需 2.4k 样本,训练快且效果好,解决了优化目标偏离、检索与生成耦合等问题,在通用和医学 QA 任务中表现出色。
超长推理还能节省计算!Salesforce开源神器两连发:教大模型边想边省,显著提升数学编程准确率
Salesforce AI Research开源Elastic Reasoning和Fractured Sampling。前者将推理流程分两部分,分配token预算,使输出缩短、准确性提高;后者打碎推理链条,从三维度采样,以更少tokens换更高准确率,均提升数学和编程任务准确率。
基础模型又一关键拼图,腾讯混元发布训练新范式「无相」:引入功能性记忆,打破静态权重枷锁
腾讯混元团队发布HY - WU范式,打破静态权重束缚,引入功能性记忆,实时生成个性化参数。应用于图形编辑基模效果好,在图像编辑任务表现优秀,还对未来AI架构提出多方面展望。
LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!
文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。