评估范式」共找到 1651 篇相关文章

推荐文章8

让外部知识“长入”模型:动态化与参数化 RAG 技术探索

检索增强生成(RAG)成大语言模型利用外部知识主流范式,但传统方法将其当黑箱,忽略动态需求和机制鸿沟。艾清遥博士介绍动态化和参数化检索增强技术,可提升准确性与适应性,减少计算开销。

AI前线
新闻资讯8

核心AI场景首超英伟达,一场国产算力的“破局叙事”|甲子光年

1月26日,天数智芯公布四代架构路线图,其2025年的天数天枢架构,在DeepSeek V3场景实测性能领先英伟达Hopper约20%。该企业以技术创新、解决行业痛点等构建新范式,产品全场景布局且已规模化落地。

甲子光年
新闻资讯8

刚刚,唐杰、杨强、杨植麟、林俊旸和刚回国的姚顺雨坐一起都聊了啥?

1月10日AGI - Next前沿峰会上,智谱AI唐杰、月之暗面杨植麟等大模型掌舵者及学界泰斗罕见同台。他们探讨AI从‘聊天机器人’进化为‘干活的智能体’,但解法各异,还在圆桌激辩多个敏感话题。

机器之心
产品应用8

别让米其林主厨削土豆!英伟达用「小脑指挥大脑」,重构AGI生产力

英伟达推出8B模型Orchestrator,通过组合工具降本增效。在HLE等测试中超越GPT - 5,成本仅为其30%左右。它还能泛化到未见工具,具有可定制调度能力,标志着复合AI新范式的兴起。

新智元
算法论文8

四足机器人首次同时「思考+走路」,北大提出链式推理MobileVLA-R1

在「大模型+机器人」浪潮中,让机器人既听懂话又走得对、稳很难。北大MobileVLA - R1将链式思考引入四足机器人,在仿真和真实实验中对标强基线实现提升,构建了更具工程可用性的范式

新智元
新闻资讯7

DeepSeek V3.2爆火,Agentic性能暴涨40%解密

文章解密了DeepSeek V3.2 Agentic性能暴涨40%的原因,即采用交错思维链机制。还对比了其与早期ReAct范式,介绍其效果、原理,以及MiniMax为落地该机制做的工作,最后提到多家模型达成技术共识。

新智元
算法论文8

传统训练效率很低?我们靠 “给模型降噪” 重新审视长上下文建模难题

文章指出长上下文模型处理长文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在长上下文任务中性能媲美GPT - 4o。

深度学习自然语言处理
推荐文章7

小白必读:到底什么是FP32、FP16、INT8?

文章介绍FP32、FP16、INT8等数字存储格式类型。指出它们是评估算力前提,不同格式在精度、范围、内存占用和计算速度上有差异,还提及多精度与混合精度计算,以及不同硬件对格式的支持情况。

芯师爷
算法论文8

让大模型学会“像人一样”查证真伪

伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。

深度学习自然语言处理
算法论文7

管你模型多大,250份有毒文档统统放倒,Anthropic:LLM比想象中脆弱

Anthropic等联合研究打破传统观念,只需250份恶意文档就能在参数规模从6亿到130亿的LLM中植入后门,且与模型规模及训练数据量无关。研究还测试了特定后门攻击,评估了多种训练配置。

机器之心