看表测试」共找到 2198 篇相关文章

算法论文8

推理token减少46%!Meta新方法缩短思维链,告别重复推导

Meta等联合提出元认知复用机制,让模型总结解题思路,提炼为“行为”存于“行为手册”。实验显示,该机制在数学基准测试中显著优化,保持准确率时最多减少46%推理token使用量。

量子位
新闻资讯7

Copilot强塞马斯克Grok新模型,遭开发者集体“抵抗”!GitHub内部工程师曝:我们是被“胁迫”的

微软旗下 GitHub 深化与 xAI 合作,将 Grok Code Fast 1 整合进 Copilot。但 GitHub 内部举报人指其安全测试不足、团队被‘胁迫’。此引发开发者‘抗议’,部分要求撤销合作,也有人好合作价值。

AI前线
新闻资讯7

疯狂……韩国开发出强大的核灾难处理人形机器人。丑,但实用

韩国原子能研究院正开发用于核灾难响应和废料处理的人形机器人,目标是能举200公斤重物。与其他机器人相比,其举重能力优势明显。不过在真实核灾难现场应用还需长期测试

AGI Hunt
新闻资讯7

大模型是「躲在洞穴里」观察世界? 强化学习大佬「吹哨」提醒LLM致命缺点

加州大学伯克利分校副教授、强化学习大牛Sergey Levine在博客指出,当前大语言模型(LLM)只是对人类大脑和思维的间接「扫描」,如同被困洞穴人类智慧「投影」,无法代替真正思维。

机器之心
算法论文7

The Batch:826 | 提高输出准确性的记忆层

通常提高大语言模型事实准确性需更大模型规模,会增加计算成本。Meta研究人员在transformer架构加可训练记忆层,可高效存储提取信息,提升计算效率,测试显示其能提升模型输出质量。

DeeplearningAI
开源动态8

代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放

检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。

机器之心
算法论文8

ICML 2025 Spotlight|华为诺亚提出端侧大模型新架构MoLE,内存搬运代价降低1000倍

华为诺亚和北大研究人员提出端侧大模型新架构MoLE。它解决传统MoE显存开销大、传输延迟高问题,推理时将专家输入改embedding token,用查找替代矩阵运算,实验显示性能与MoE相当,大幅降推理延迟。

机器之心
产品应用7

The Batch: 978 | DeepSeek-V4-Pro 更新了

DeepSeek发布旗舰模型DeepSeek-V4-Pro-0813正式版,性能提升,还发布开源agent harness开发者预览版并提价。模型在多指标现佳,编码能力改进明显,公司公开基准测试框架意义大。

DeeplearningAI
新闻资讯7

GPT-5.2已上线24小时:差评如潮!

OpenAI 十周年推出号称强大的 GPT - 5.2,却差评如潮。它在 SimpleBench 测试结果不佳,回答不稳定,编程和艺术创作效果差,情商低、不通人性,审查和安全拒绝机制也饱受诟病。

机器之心
开源动态8

比Gemini 3记得更多,谷歌新框架将上下文记忆干到了200万!

Google在NeurlPS2025大会推出结合RNN与Transformer的全新架构Titans,能扩展到超200万个token上下文。背后涉及Titans和MIRAS两篇论文,共同推进测试时记忆概念,实验显示新架构性能出色。

PaperAgent