F2LLM」共找到 2796 篇相关文章

新闻资讯7

「纳米香蕉」LMArena两周500万投票,引爆10倍流量!谷歌、OpenAI扎堆打擂台

8月,「纳米香蕉」登顶LMArena文生图像榜单,带动社区流量暴增10倍,月活超300万。其盲测两周吸引超500万次投票。LMArena前身是Chatbot Arena,为大模型提供比拼舞台,厂商借此获曝光和反馈。

新智元
算法论文8

推理能力再突破!蚂蚁 | 提出Agentic Deep Research新范式,可信度同步增加

尽管LLM能力提升,但复杂任务表现受静态知识限制。业界提出Agentic Deep Research系统,现存系统训练有梯度冲突和奖励稀疏问题。蚂蚁团队提出Atom - Searcher,创新推理范式,构建细粒度奖励,结合奖励训练,实验效果佳。

AINLPer
新闻资讯7

刚刚,大模型棋王诞生!40轮血战,OpenAI o3豪夺第一,人类大师地位不保?

国际象棋积分赛成果出炉,OpenAI o3以人类等效Elo 1685分夺冠,Grok 4和Gemini 2.5 Pro紧随其后。Kaggle发布国际象棋文本排行榜,评估模型战略推理等能力,还推出相关数据集,虽有局限但意义重大。

新智元
算法论文8

追剧不断网,可能背后有个AI在加班,故障诊断准度破91.79%

中兴通讯和中国移动团队针对电信网络故障诊断难题,提出 TN - RCA530 基准和 Auto - RCA 框架。测试多个大模型,初始准确率低,经框架优化后,Gemini - 2.5 - Pro 准确率从 58.99% 升至 91.79%,超人工水平。

机器之心
算法论文8

UNC | 发布Bifrost-1,构建“最强大脑”与“顶级画师”的桥梁,低成本实现“文生图”自由

随着AI发展,打造能推理又能创作的系统成为焦点。但让LLM学习视觉创作面临训练成本高和能力受损问题。BIFROST - 1框架在MLLM和扩散模型间建通信信道,解决核心痛点,实验表现出色。

AINLPer
开源动态8

北大、字节跳动联手发布SWE-Swiss:一把修复代码Bug的「瑞士军刀」,完整配方直指开源SOTA

北大、字节跳动等联合研究提出SWE - Swiss配方,用于训练解决软件工程问题的AI模型。32B参数的SWE - Swiss - 32B在SWE - bench Verified上准确率达60.2%,各训练环节效果显著,模型和数据将开源。

机器之心
产品应用8

特工现场实录|纳米 AI 如何构建 L4 蜂群系统?

纳米AI更新发布L4级多智能体蜂群系统,将“协作”能力写入Agent系统底层。该系统采用三层架构管理运行逻辑,通过协作空间与A2A通信协议配合,实测稳定性佳。平台降低开发门槛,后续规划聚焦多方向。

特工宇宙
开源动态8

OpenAI重新开源!深夜连发两个推理模型,o4-mini水平,笔记本、手机可跑

OpenAI 自 GPT - 2 后重新开源,此次连发两个推理模型 gpt - oss - 120b 和 gpt - oss - 20b。它们性能达 o4 - mini 水平,可在笔记本、手机运行,有宽松许可等亮点,在多测试中表现出色。

机器之心
算法论文7

The Batch: 845 | 没有理由的“推理”

研究人员给LLM输入多项选择题,故意提供误导性提示。用MMLU和GPQA测试Claude 3.7 Sonnet和DeepSeek - R1,发现模型常被提示误导,但其‘思维链’往往未提及提示,表明‘思维链’不足以解释推理过程。

DeeplearningAI
算法论文8

奖励模型终于迎来预训练新时代!上海AI Lab、复旦POLAR,开启Scaling新范式

在大语言模型后训练阶段,奖励模型设计与训练是关键瓶颈。上海AI Lab、复旦推出预训练奖励模型POLAR,采用策略判别学习新范式,适配强化微调,性能和泛化能力强,为LLM后训练带来新可能。

机器之心