测试时训练」共找到 4023 篇相关文章

算法论文7

多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合

清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。

量子位
新闻资讯8

华为+DeepSeek,推理性能创新高!技术报告也公布出来了

华为昇腾在部署超大规模MoE推理性能创新高,全面超越英伟达Hopper架构。其采用‘以数学补物理’方式,还将全面开源。团队从多方面优化,在不同硬件上取得优异性能,本周还将举办技术披露周。

量子位
算法论文8

ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE

长文本能力对语言模型重要,但现有模型训练窗长有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升长文本泛化能力,实验表现超RoPE。

机器之心
算法论文8

ICML 2025 Spotlight|华为诺亚提出端侧大模型新架构MoLE,内存搬运代价降低1000倍

华为诺亚和北大研究人员提出端侧大模型新架构MoLE。它解决传统MoE显存开销大、传输延迟高问题,推理将专家输入改embedding token,用查找表替代矩阵运算,实验显示性能与MoE相当,大幅降推理延迟。

机器之心
算法论文7

拟合接近满分,外推却会跑偏:Meta 给缩放律加了一个指数

大模型训练前,团队常用 Chinchilla 缩放律估算模型规模和数据量,但它在模型和数据极不平衡的边界预测易跑偏。Meta FAIR 提出的 Skaling 只增加一个耦合指数,降低外推误差,还采用 L 形采样降低试算成本。

深度学习自然语言处理
新闻资讯8

手握1000项专利的“药物狂人”,为何在AI制药代选择逆行?

手握约1000项专利的再生元联合创始人乔治·扬科普洛斯,在AI制药成热点选择逆行,坚持内部研发、人类遗传学和基础生物学。他批评跟风,强调深入理解疾病机制,认为AI可增效但不能决定方向。

DeepTech深科技
开源动态8

AI给你的总是平庸答案?5.8万星插件证明:问题不在模型,在你

GitHub上5.8万星的`taste-skill`仓库,无模型代码,仅用文本规则让AI编程工具输出更有品味。揭示AI默认给平庸答案是概率采样结果,还给出反中位数三问及AI代变贵的是判断力。

AI Reading Hub
产品应用7

腾讯 Hy3 一手实测,Agent 能力提升不止一点

作者拿到 Hy3 模型测试资格,介绍其架构、性能和价格优势,还在 WorkBuddy 里实测它完成运营工作、选编辑助教、开发新功能等任务的效果,最后评价 Hy3 能力、价格、适配方面的表现,并分析 WorkBuddy 领先原因。

特工宇宙
新闻资讯7

前后端一起消失:AI Coding正在改写大厂工程师分工

大厂研发组织出现调整,美团前后端团队合并,蚂蚁网商让测试岗转研发岗。AI Coding普及使技术岗位划分重塑,前后端边界成“全栈能力”。AI编程工具虽有后端执行能力,但仍需资深工程师兜底。

InfoQ
产品应用8

Qwen3.7:智能体新前沿

阿里云正式发布面向智能体代的Qwen3.7-Max模型,将通过API提供服务。它能力全面,编程、办公、长周期执行等表现出色,适配多框架,在多场景评测中领先,能驱动生产力跃升,还经多实战测试验证实力。

千问大模型