长任务跑分」共找到 2684 篇相关文章

算法论文8

GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」

大模型推理能力难迁移到小模型,现有强化学习方法如GRPO在小模型上性能提升有限。香港中文大学(深圳)唐晓莹教授团队提出G²RPO - A算法,缓解小模型奖励稀疏问题,在多模型实验中表现优于vanilla GRPO。

机器之心
产品应用8

智谱GLM-5.1深度评测:8小时连续工作,开源大模型进入"工程交付"新纪元

2026年4月8日智谱发布GLM-5.1,它是全球首个通过真实工程任务验证8小时持续工作能力的开源模型,在SWE-Bench Pro上超越GPT-5.4等登顶。该模型性价比高、技术创新多,还适配国产硬件,开源生态友好。

机器学习AI算法工程
产品应用8

龙虾创始人深夜点赞:百度 DuMate,打工人的 AI 搭子

文章介绍百度新上线的产品 DuMate,它被定位为首个「国产企业级满血版 OpenClaw」。安装简单,能深度集成百度工具生态,部署方便且安全。通过多场景实测,其任务完成度高,是打工人实用的 AI 搭子。

特工宇宙
新闻资讯8

Karpathy:写了20年代码,现在像作弊

Karpathy曾造词“vibe coding”,一年后弃用。他开源autoresearch项目,让AI Agent自主实验,自己不写代码。他还展示家庭监控分析系统也由Agent完成。他提出“agentic engineering”,认为工具虽变,但深度技术专更重要。

新智元
算法论文8

为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练

社区里期存在的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且在多模型和硬件上验证有效。

机器之心
开源动态8

社区供稿丨Ring-2.5-1T,思更深,行更远

今天发布并开源万亿参数思考模型 Ring-2.5-1T,在生成效率、思考深度、程执行上大幅提升。与其他模型对比,在高难推理和任务执行达开源领先。介绍架构优势、手搓案例,也提及不足与未来计划。

Hugging Face
开源动态8

阿里开源Qwen3-Coder-Next,80B参数仅激活3B的MoE顶尖编程助手

阿里开源小型MoE代码模型Qwen3 - Coder - Next,总参数量800亿但仅激活30亿参数,在代码生成等任务表现出色。团队构建训练技术栈解决数据匮乏,模型训练分阶段,多领域专家模型能力整合,基准测试性能强劲。

AIGC开放社区
算法论文8

比人类专家快2倍,斯坦福联合英伟达发布TTT-Discover:用「测试时强化学习」攻克科学难题

斯坦福与英伟达等机构联合提出 TTT - Discover 方法,让 LLM 在测试时强化学习。它在多任务上成绩出色,如在数学、GPU 内核等领域超越人类和其他 AI,计算成本低,或为持续学习打开新空间。

机器之心
算法论文8

JCP | 南科大邹欣桐、王建春等:神经算子在三维湍流预测中的不确定度和稳定性分析

本文以三维各向同性湍流为例,提出面向神经算子的可信度评估框架,考察预测误差不确定度、时迭代稳定性及流场时间相关性对模型可靠性的影响。结果显示,物理约束和合理时间步可提升模型稳定性与可靠性。

力学与人工智能
新闻资讯8

从豆包手机谈起:端侧智能的愿景与路线图

近日,字节跳动发布豆包手机助手,标志大模型应用从‘Chat’迈向‘Action’。文章解析其关键技术,指出虽具实用价值,但端侧智能体面临安全、自主任务、个性化服务等挑战,还展望了手机助手与端侧智能体的未来发展。

AI前线