「MMAR基准测试」共找到 2051 篇相关文章
思维链可无限延伸了,MIT等打破大模型上下文天花板
MIT等机构提出新架构Thread Inference Model(TIM),配合专用推理引擎TIMRUN,把推理过程变为树状递归子任务结构并修剪子任务,让模型突破输出窗口限制实现长程推理,实验验证了其性能。
华人团队终结Token危机:扩散模型数据潜力超自回归三倍
最新研究发现,token数量受限下,扩散语言模型数据潜力超自回归模型三倍多。一个1B参数的扩散模型用1B tokens训练,在基准测试取得不错准确率,且未现性能饱和。
半量工具,双倍效能:ARPO革新大模型强化学习
大语言模型在多轮工具调用场景有挑战,传统强化学习算法有探索效率低和资源消耗大问题。本文提出ARPO,通过量化token熵分布变化设计自适应探索机制,降低工具调用成本且提升多轮推理性能。
EvaLearn:AI下半场的全新评测范式!
OpenAI研究员指出传统基准测试难衡量AI实际效用。复旦大学与字节跳动等团队提出全新评测范式EvaLearn,以连续问题求解为核心,构建问题并设评分标准,对九个前沿大模型研究有诸多发现。
揭示隐藏联系:RLHF/DPO即对比学习!
大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
黎曼猜想推至理论边界99.55%!元代理架构AI:在思考中重塑大脑
科学家面临让AI解决复杂科学难题的问题,传统固定架构AI处理特定复杂问题不顺手。近日学术团队提出Eureka架构,能让AI动态“生长”专用“大脑”,在测试中表现出色,还在数学和物理领域有重大成果。
港中文联手美团开源“视觉推理通才”!图像视频10类任务一网打尽
香港中文大学MMLab与美团研究团队开源OneThinker模型,它可覆盖图像与视频十类核心视觉任务,在31项测试中表现出色,还展现泛化能力。研究团队搭建数据集,并引入EMA - GRPO算法提升训练稳定性。
抢先体验GenFlow2.0:未来多Agent协作的理想形态
作者在百度邀测会抢先体验Genflow 2.0,用其解决小学教改信息查询问题,还让它生成创意图片。它得益于“沧舟OS”,有流畅、并发且跨模态能力,架构全自研,测试版亮点多,值得期待8月正式上线。
媲美DeepSeek!腾讯开源新版混元模型:AI Agent强化,超30种智能体指令
腾讯开源混元大模型最新版本Hunyuan - A13B,为专家混合模型,有800亿参数,130亿激活。支持快慢思考模式,针对AI Agent强化,设计超30种智能体指令。测试成绩超DeepSeek - R1等,架构和训练有优化。