「推理评估」共找到 2645 篇相关文章
「超级智能」终极拼图曝光!小扎连撬OpenAI灵魂研究员,Meta梦之队已成形
扎克伯格从OpenAI等机构挖来九位AI顶级人才,涵盖数据、模型、推理等领域,组建无短板「梦之队」,全力冲刺Meta通向超级智能的最后一跃。此前Meta曾高价挖角OpenAI联合创始人,均遭拒绝。
苹果出手!改进GRPO,让dLLM也能高效强化学习
苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。
将思维链(CoT)引入具身世界,哪种路径能真正打通机器人「知行合一」?
文章围绕将思维链(CoT)引入具身智能领域展开。介绍CoT从语言层面到成为机器人行为核心认知机制的转变,分析分层架构与端到端模型两种技术路径,还阐述自变量机器人统一架构的优势和能力。
刚刚,谷歌AI路线图曝光:竟要抛弃注意力机制?Transformer有致命缺陷!
谷歌未来AI路线图曝光,Gemini全模态是重点,模型向智能体转变,推理能力将扩展。谷歌还需突破现有注意力机制限制实现无限上下文。此外,文中盘点了OpenAI、DeepSeek等大厂AI年中表现。
AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%
大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。
LeCun亲自官宣!Meta世界模型V-JEPA 2登场!仅用62小时机器人数据,就能实现零样本控制!
Meta发布V-JEPA 2世界模型及三个新基准测试,Meta首席AI科学家Yann LeCun介绍其不同。V-JEPA 2基于视频训练,用62小时机器人数据就能实现零样本控制,还将探索分层式模型和多模态建模。
北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师
北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。
比自回归更灵活、比离散扩散更通用,首个纯Discrete Flow Matching多模态巨兽降临
近年来多模态大模型多采用自回归架构,推理缺乏灵活性。香港大学和华为诺亚方舟实验室研究团队提出FUDOKI,基于全新非掩码离散流匹配架构,能并行去噪、动态修正,为多模态模型开辟新路径。
The Batch:827 | Claude 4 推动代码生成能力再升级
Anthropic 发布 Claude 4 Sonnet 和 Claude 4 Opus 模型,支持“推理模式”,能并行调用工具。还发布 Claude Code 编程智能体及 SDK。两款模型输入输出能力强,功能亮点多,性能表现佳,有多种使用渠道和定价。
Meta「轻量级」KernelLLM颠覆GPU内核生成,8B参数碾压GPT-4o
Meta推出基于Llama 3.1微调的8B参数KernelLLM,能将PyTorch代码转高效Triton GPU内核。实测单次推理性能超GPT - 4o和DeepSeek V3,多次生成得分更高,让内核开发更易上手。