两小时学习法」共找到 2362 篇相关文章

新闻资讯7

FlashAttention-4震撼来袭,原生支持Blackwell GPU,英伟达的护城河更深了?

在 Hot Chips 2025 上,TogetherAI 首席科学家 Tri Dao 公布 FlashAttention-4,其在 Backwell 上比英伟达 cuDNN 库中的注意力核实现快 22%,还实现项算法改进。该技术一直迭代升级,提升了注意力计算效率。

机器之心
新闻资讯8

OpenAI高管自爆:Scaling不死,GPT-5「双轴训练」撕开智能天花板

OpenAI首席运营官Brad Lightcap在对话中揭秘GPT-5,其能自主判断是否深度推理再作答,体验全面升级。训练方式有后训练,Scaling Law仍成立,未来从轴改进。还探讨了AGI、应用场景等。

新智元
算法论文8

ICCV 2025 | RobustSplat: 解耦致密化与动态的抗瞬态3DGS三维重建

3DGS技术成研究热点,但现有方法在含动态物体场景建模精度不足。中山大学等研究者提出RobustSplat,有延迟高斯生长和尺度级联掩码引导大核心设计,实验显示其在多指标上领先基线方法。

机器之心
算法论文8

ICCV 2025 | HERMES:首个统一3D场景理解与生成的世界模型

本文介绍HERMES,首个统一3D场景理解与生成的世界模型。它由华中科技大学等团队合作研发,通过共享LLM驱动大任务,解决了输入处理和任务融合难题,实验效果显著,为自动驾驶提供新范式。

机器之心
算法论文8

UNC | 发布Bifrost-1,构建“最强大脑”与“顶级画师”的桥梁,低成本实现“文生图”自由

随着AI发展,打造能推理又能创作的系统成为焦点。但让LLM学习视觉创作面临训练成本高和能力受损问题。BIFROST - 1框架在MLLM和扩散模型间建通信信道,解决核心痛点,实验表现出色。

AINLPer
新闻资讯7

GPT-5的魔幻现实主义:当技术神话撞上用户预期

奥特曼宣传数月的GPT - 5上线24小时遭用户吐槽,实测基础数学、拼写有问题。其采用智能路由系统,调教欠佳。奥特曼承认自动切换器故障,基准测试结果混乱,还暴露AI评价难等问题。

AI工程化
算法论文8

ACL'25最佳论文解读 | 大模型也会‘弹簧回弹’?揭秘 LLM 对齐的脆弱根源

本文分享 ACL 2025 最佳论文,指出预训练大模型存在‘抗对齐’的 Elasticity 现象,即对齐微调只是暂时拉伸,后续微调会让其迅速弹回预训练分布。研究量化该概念,用‘压缩理论’刻画对齐并实验验证。

PaperAgent
产品应用8

非Transformer架构落地之王,带着离线智能和原生记忆能力在上海WAIC浮出水面

在上海WAIC现场,RockAI展台的机器狗和灵巧手在离线状态表现出色,背后是其非Transformer架构的大模型Yan 2.0 Preview,有原生记忆和离线智能能力。该公司成立年,押注此架构,产品已商业落地,还构想群体智能未来。

量子位
算法论文8

机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验

丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。

机器之心
算法论文8

IEEE TPAMI 2025 | 北京大学提出LSTKC++,长短期知识解耦与巩固驱动的终身行人重识别

北京大学周嘉欢团队在IEEE TPAMI发布LSTKC++研究成果。该框架引入长短期知识解耦等机制,保障模型学习新知识和记忆历史知识。代码已开源,研究在性能和效率上优势明显,有广泛应用价值和拓展空间。

机器之心