「物理空间推理」共找到 2828 篇相关文章
Thinking Machines 发布又一神作「在线策略蒸馏」 ,LLM后训练效率飙升50-100倍
Mira的THINKING MACHINES开源「在线策略蒸馏」LLM后训练方法,结合两种主流后训练范式优点,提升训练效率50 - 100倍,成本降低9到30倍,可用于数学推理、模型个性化等场景。
GPT-5 核心成员详解 RL:Pre-training 只有和 RL 结合才能走向 AGI
本文编译 OpenAI 研究副总裁 Jerry Tworek 访谈,探讨 RL 与通向 AGI 路径。他认为 pre - training 与 RL 需结合,GPT - 5 是 o3 迭代,还谈及推理、模型发展、训练方式及 OpenAI 研究情况等。
9月全球值得一看的24件新媒体艺术作品
MANA平台9月分享24件全球新媒体艺术作品,涵盖12个国家,有创意反诈短片、未来零售空间、多媒体舞台等,涉及AI、混合现实等技术,展现艺术与科技融合,还开启投票助力创作者。
马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?
Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。
清华SageAttention3,FP4量化5倍加速!且首次支持8比特训练
清华大学陈键飞团队提出针对BlackWell架构的SageAttention3,实现5倍于FlashAttention的推理加速,首次支持8比特训练。在多种大模型上保持端到端精度,代码将分别于6、7月开源。
5000次风暴,谷歌训出AI预言家!天气预报ChatGPT时刻?
谷歌DeepMind与谷歌研究团队推出交互式气象平台Weather Lab,共享人工智能天气模型。其新模型在热带气旋路径预测上刷新SOTA,是首个超越主流物理模型的AI预测模型,有望拯救数万生命。
字节会师何恺明!开源连续扩散语言模型Cola DLM
字节会师何恺明,开源连续扩散语言模型Cola DLM,释出论文、代码等。该模型跳出离散token束缚,把生成过程交给连续空间,在实验中展现出稳定scaling趋势,其动机是表征而非diffusion。
后训练中的RL已死?MIT新算法挑战传统后训练思维,谢赛宁转发
MIT研究人员提出RandOpt新算法,挑战传统后训练思维。该算法通过随机扰动和集成突破限制,在多任务中表现出色,揭示了预训练模型权重空间的“神经丛林”现象,引发AI社区关注。
GPT-5:我更强了,就这?“看不见”的升级
OpenAI 发布 GPT - 5,它未带来 AGI 相关的震撼升级,而是更注重实用。其训练有新特点,具备推理强、编程能力提升等特性,是 AI 从‘模型炫技’到‘产品体验打磨’转变的标志。
先别急着给OpenAI加冕!陶哲轩:这种「金牌」,含金量取决于「赛制」
OpenAI 官宣推理模型在 IMO 获金牌水平成绩,此前各模型表现不佳。数学家陶哲轩劝谨慎看待,认为无严格测试条件难比较 AI 与人类。网友看法不一,模型训练方法及 Alexander Wei 受关注。