「多模态数学推理」共找到 2913 篇相关文章
斯坦福7B智能体全面超越GPT-4o,推理流登顶HF
传统智能体系统难兼顾稳定性和学习能力,斯坦福等团队提出AgentFlow框架,通过模块化和实时强化学习优化策略,使7B参数模型在多任务上超越GPT - 4o等大模型,为AI发展提供新思路。
只要9美元!LoRA+强化学习,DeepSeek 1.5B推理性能暴涨20%
南加州大学团队基于LoRA的强化学习训练1.5B推理模型,在AIME 24测试上性能提升超20%,成本仅9美元。开源Tina模型结合三大关键技术,与SOTA模型相比竞争力强,研究者还对其有效性提出假设。
AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了
来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。
陶哲轩亲测!GPT-5 Pro 40分钟破解3年难题,登顶最难数学考试
数学家陶哲轩将几何难题交给GPT - 5 Pro,虽推理完美但无解。同一周,GPT - 5 Pro在FrontierMath测试集夺冠。陶哲轩测试发现AI在科研不同层面表现有别,也揭示了AI理解力受限及人类与AI的分工边界。
超越宇宙极限:第六位海狸数再次突破,无法用常规数学符号表达
本文介绍「忙碌海狸数」,其前五项为1、6、21、107、47176870。研究人员先后确定前四个数,如今BB(6)再突破,新下界需用新数学符号表达。还回顾探索历程,提及社区用Coq证BB(5),并指出BB(6)真实值难测。
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
破解遥感目标的形状与尺度难题,PKINet二代推理提速近4倍!
PKINet - v2是改进的遥感目标检测模型,能处理复杂形状和尺度变化问题。它在PKINet基础上升级,统一条带与方形卷积,部署时折叠为单大核。在多数据集上精度和速度提升,可服务多领域,但对特殊目标仍有检测问题。
全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!
Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。
为什么HBM能摆脱传统周期?
当前市场对HBM和DRAM能否摆脱传统半导体周期性存争议。过去半导体周期由消费电子换机节奏驱动,而AI推理不同,大模型推理对内存依赖是硬约束,GPU更新对HBM需求几乎注定指数级增长。
VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架
VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。