「大学排名」共找到 571 篇相关文章
SFT在帮倒忙?新研究:直接进行强化学习,模型多模态推理上限更高
学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但新研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型多模态推理上限更高,该团队训练的模型还刷新了纪录。
RSS 2025|物理驱动的世界模型PIN-WM:直接从视觉观测估计物理属性,可用于操作策略学习
国防科大、深圳大学、武汉大学团队提出物理驱动的世界模型PIN - WM,能从视觉观测辨识刚体物理属性。还提出PADC提升迁移性能,经实验验证其在非抓握式操作技能Sim2Real迁移中表现出色。
新站上线一周,一天从谷歌获取2.85万点击是什么体验。
新网站上线后,如何快速获得谷歌的曝光和点击?哥飞和良辰美通过新词新站理论,实现了网站流量的大幅提升。但排名波动和曝光点击数的差异,背后的原因究竟是什么?
为什么 Agent Memory需要 AML:看 AML “变量控制”的工程设计
传统 Agent 记忆评测有水分,近日放榜的 Agent Memory Leaderboard (AML) 通过严格控制变量构建盲测管线。文章从技术架构深拆其工程细节,还分析了首期榜单,指出其重构评估变量的价值。
华为天才少年一作,港大MaRS Lab拿下IEEE TRO傅京孙纪念最佳论文奖
近日,香港大学MaRS Lab张富副教授团队研发的FAST-LIVO2获IEEE TRO傅京孙纪念最佳论文奖。该论文由华为天才少年郑纯然一作,提出新的SLAM技术思路,项目开源受关注,相关技术也在向产业延伸。
利润腰斩也要卷AI!小米模型永久降价99%,雷军还要再砸600亿
今日小米宣布 MiMo-V2.5 系列 API 永久降价,最高降 99%,Token 额度提升。虽 2026 年 Q1 财报显示利润腰斩、营收下滑,雷军仍称今年 AI 投 160 亿,未来三年投 600 亿。此前 DeepSeek 也已降价,中国大模型在 OpenRouter 表现亮眼。
ICLR 2026 | 越推越快! 首个面向「Test-Time Scaling」的投机解码基准
文章指出推理阶段扩展(TTS)能提升推理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准,评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。
一个模型千万个灵魂!Anthropic找到了防止AI陷入疯狂的防线
Anthropic和牛津大学研究发现,大模型的AI助理角色易在长对话中漂移崩塌,致其陷入幻觉。研究解析助理轴,揭示模型人格定位,还提出激活上限技术,能在保能力的同时降低有害回复率。
学界大佬吵架金句不断,智谱和MiniMax太优秀被点名,Agent竟然能写GPU内核了?!
卡内基梅隆大学助理教授蒂姆·德特默斯与加州大学圣地亚哥分校助理教授丹·傅,就AGI是否会实现展开争论。他们还谈到算力、Agent应用等话题,看好小模型、开源模型等发展,认可中国大模型进步。
大模型化身苏格拉底:通过主动提问挖掘人机协作的深度
微软与南加州大学联合团队研究揭示激发大模型主动提问能力新范式。通过定义主动信息收集任务、提出强化微调策略,经实验验证该方法有效,使模型在多领域表现出色,重新定义大模型角色。