F2LLM」共找到 2794 篇相关文章

算法论文8

We-Math 2.0:全新多模态数学推理数据集 × 首个综合数学知识体系

北京邮电大学、腾讯微信、清华大学团队提出We - Math 2.0,含知识体系、数据集及训练策略,可提升模型数学推理泛化能力。该成果在X上获关注,登Huggingface Paper日榜第一。

机器之心
算法论文8

扎克伯格的豪赌初见成效?Meta新方法让LLM长上下文处理提速30倍

Meta Superintelligence Labs提出REFRAG高效解码框架,解决LLM长上下文输入效率瓶颈。它通过四步流程优化解码,让首个token生成时间加速达30.8倍,扩展上下文,且精度不降反升,不过价值待实际检验。

机器之心
产品应用7

谷歌放大招!Gemini「吞下」2.5亿地图数据,路痴AI一夜成精

谷歌推出「Grounding with Google Maps」功能,让Gemini接入Google Maps,可调用2.5亿地点信息。本次更新拓展了AI能力边界,适用于多领域,部分Gemini模型支持,还介绍了使用示例。

新智元
算法论文8

告别随机性:Thinking Machines Lab如何实现了LLM推理的完全确定性?

文章指出LLM推理非确定性根源并非GPU并发和浮点非结合性,而是批大小变化致核函数非不变性。作者提出实现批不变操作的策略,实验验证有效,还阐述其对训练、系统可靠性等方面的意义。

深度学习自然语言处理
产品应用8

马斯克悄悄改了战场:Grok Build 0.2.60 剑指 Agent Runtime

2026年6月21日,Grok Build发布0.2.60版本更新,未推新模型能力,而是聚焦Runtime细节,针对会话难恢复、长任务易卡住、工具输出易污染上下文等痛点优化,让Agent更稳定可靠。

AI科技评论
开源动态7

让NCCL性能起飞的symmetric memory是啥黑科技?— part2

本文是NCCL 2.27新特性系列的第二部分,主要分析symmetric primitives的实现机制,介绍其提供的接口,如获得symmetric ptr、barrier、send、recv、llEpoch控制等接口,还解析了底层结构内存布局、各接口工作机制及LL Buffer划分机制等。

GiantPandaLLM
开源动态8

GLM-5.2 正式发布:开源之王来了,摸到了Opus-4.8

GLM-5.2正式发布,主打长程任务能力,有1M token上下文窗口且完全开源。它在长程任务基准评测中表现出色,与顶级闭源模型差距缩小,还解决了超长上下文计算成本问题,同时应对了模型‘作弊’情况。

AI寒武纪
算法论文7

ACL2025 | 传统符号语言传递知识太低效?探索LLM高效参数迁移可行性

中科院自动化所谭宇乔等研究跨规模大模型参数知识迁移(PKT)可行性。指出传统符号语言传递知识低效,LLM 模仿此范式也有局限。提出新 Pre - Align PKT 范式,实验分析 PKT 效果,揭示神经不兼容性致其失败。

机器之心
算法论文8

以星为舵:LLM的Post-Train与Rest-Time奖励学习综述

这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。

深度学习自然语言处理
Product Application7

Wan 2.6 发布,可以参考视频进行角色扮演 & 终于有积分了:每天 150

Wan 2.6发布,积分从每天10个提升到150个。更新了主演、多镜头叙事、图像生成等新功能,如可将参考视频角色放入新场景,简单提示自动生成多镜头叙事视频等。

AI进修生