「复杂推理能力」共找到 5117 篇相关文章
Gaia2 与 ARE:赋能社区的智能体评测
文章介绍 Gaia2 与 ARE,Gaia2 是智能体基准 GAIA 升级版,能分析复杂行为,与 ARE 框架一同发布。ARE 可模拟复杂真实条件,支持定制。文中对比多款模型,指出当前模型挑战,并说明评测步骤和 ARE 使用场景。
关于机器人数据,强化学习大佬Sergey Levine刚刚写了篇好文章
训练大模型难度随规模和应用拓展而增加,所需数据海量。机器人领域获取训练数据成本高,研究者尝试找替代方案。强化学习大牛Sergey Levine分析数据组合,认为鱼和熊掌不可兼得,替代数据有局限。
万帧?单卡!智源研究院开源轻量级超长视频理解模型Video-XL-2
长视频理解是多模态大模型关键能力,当前开源模型有短板。智源研究院联合发布 Video-XL-2,多维度优化长视频理解能力,还设计效率优化策略,在主流评测基准表现出色,有广泛应用潜力。
AI学会左脚踩右脚自进化?Meta华人新研究改写Agent法则
Meta华人学者Jenny Zhang联合多机构研究者提出新智能体框架HyperAgents(DGM - H)。它打破任务能力与自我改进能力需对齐的局限,能跨任务自我改进,还自动生成基础设施,或改写Agent竞争规则。
字节开源GUI Agent登顶GitHub热榜,豆包手机核心技术突破26k Star
字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热榜,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简单,历经多轮迭代,成为热门开源多模态Agent。
社区供稿 | 开源SOTA:阶跃发布端到端语音大模型Step-Audio 2 mini!
阶跃星辰发布最强开源端到端语音大模型 Step - Audio 2 mini,在多个国际基准测试集获 SOTA 成绩。它统一建模语音理解等,率先支持语音原生 Tool Calling 能力,架构创新,案例展示其多方面强大能力。
【博客转载】CUDA Local Memory
文章围绕CUDA本地内存展开,介绍其为线程私有存储空间,访问特性与全局内存类似。通过两个计算滑动平均值的CUDA kernel示例,展示数组索引复杂度对存储位置的影响,还给出判断存储位置的方法及优化建议。
2025年4月17日消息,OpenAI 连发o3和o4 mini,o3为强大推理模型,o4-mini专为高效推理优化。它们能调用ChatGPT工具,可基于图像思考。OpenAI还开源本地代码智能体Codex CLI,兼容所有模型。
黎曼猜想推至理论边界99.55%!元代理架构AI:在思考中重塑大脑
科学家面临让AI解决复杂科学难题的问题,传统固定架构AI处理特定复杂问题不顺手。近日学术团队提出Eureka架构,能让AI动态“生长”专用“大脑”,在测试中表现出色,还在数学和物理领域有重大成果。
ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE
长文本能力对语言模型重要,但现有模型训练窗长有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升长文本泛化能力,实验表现超RoPE。