评估策略」共找到 1560 篇相关文章

算法论文8

谷歌Jeff Dean和多位图灵奖得主合著论文,全面剖析了AI

谷歌Jeff Dean和图灵奖得主John Hennessy等联合发布报告《塑造AI对数十亿人的影响》,拒绝AI极端观点,选择务实。报告剖析打破“饭碗焦虑”、重塑教育医疗等内容,Laude研究所也开展实战评估项目。

新智元
开源动态8

打破大模型编程「数据污染」与「能力虚胖」困境,Meituan-M17团队构建新一代AI编程评测新标准——OIBench

当前大语言模型编程能力评估体系问题多,如评测集饱和、数据泄漏等。Meituan - M17团队推出OIBench数据集,对18个主流大模型评测,揭示模型真实水平,还将举办人机协作编程竞赛。

机器之心
推荐文章8

AI Infra进阶:如何让大模型输出确定的结果

文章探讨大模型输出确定性结果的问题。指推理引擎底层动态组批与算子调度策略,因浮点加法顺序变化使结果波动。还分析GEMM、RMSNorm等算子影响,给出vLLM实现Batch Invariance的方法。

腾讯技术工程
算法论文7

LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!

文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。

AINLPer
算法论文7

“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%

文章聚焦多模态长文档视觉问答,介绍现有LVLM - based和RAG - based技术路线及困境。提出MMRAG - DocQA方案,引入‘分层索引 + 多粒度检索’,设计双索引建模相关性与依赖,用互补策略实现证据互补。

CourseAI
算法论文8

ParScale:一种全新的大模型Scaling Law

文章提出并行扩展(ParScale)路线,在不增模型参数下,通过引入并行流提升性能。新扩展定律打破传统范式,两阶段后训练策略降成本,还适用于边缘设备,研究仍在进行。

通义千问Qwen
开源动态8

文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”

港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。

量子位
新闻资讯7

Anthropic "泄露"Claude Mythos 最强模型到底有多猛?

Fortune爆出Anthropic因CMS配置失误,致新模型Claude Mythos信息泄露。该模型有阶跃式进步,在多领域表现超前代,网络安全能力突出。此事反映AI迭代快但安全待提升,安全成模型评估关键。

CourseAI
开源动态8

AI下半场的战场,从Agent记忆体正式打响

OpenClaw开源项目爆火,标志AI进入下半场走向真实应用。关键在于解决AI在现实中持续干活的问题,核心是Agent Memory。论文梳理该赛道,指出其是系统级记忆体结构框架,未来关键在memory策略可学习。

机器之心
开源动态7

用Rust重写OpenClaw,Transformer作者下场造了安全版「龙虾」

Transformer八子之一Illia Polosukhin用Rust构建安全版OpenClaw——IronClaw。他指出OpenClaw有数据和资金安全风险,IronClaw以安全为核心,有多项安全设计,未来还会增加策略验证等能力。

机器之心