大模型架构图」共找到 9891 篇相关文章

算法论文8

ICML 2026获奖论文揭晓:黄高团队获杰出论文,A3C算法获时间检验奖

ICML 2026公布最佳论文奖项,共10篇获奖,涵盖杰出论文奖、杰出立场论文奖等。此次评选严格,经多轮筛选。获奖论文涉及扩散式语言模型、扩散模型采样算法等多个领域。

机器之心
开源动态8

首个自主数据科学的智能体

DeepAnalyze是业界首个能自主完成数据科学任务的智能体语言模型,可自动执行数据准备、分析等任务,支持多种数据源,且模型、代码等全部开源,还给出了使用和开发方法。

GitHubStore
新闻资讯7

英伟达员工晒年终奖,黄仁勋霸气签皮衣;Moltbook爆火:当AI有了自己的社交网络;又一“95后”清华天才科学家庞天宇加盟腾讯混元 | Q资讯

本文汇总 AI 行业热点,有 Moltbook 成 AI 社交平台且爆火;OpenAI 两款产品用户流失;亚马逊、Meta 裁员;英伟达年终奖、合作协议情况;阿里发布千问新模型;还有厂春节发红包竞争,DeepSeek 布局新领域等消息。

InfoQ
开源动态8

没想到,32B清华DeepDive掀翻深度搜索全场的!

文章指出模型在真实深网搜索场景表现不佳,核心矛盾是缺‘难搜’数据和多轮工具调用 RL。清华 DeepDive 用数据合成造‘难搜’题,端到端多轮 RL 训练,在 BrowseComp 刷新开源记录,迁移能力也强。

PaperAgent
7

统治AI十年的Transformer,要被亲爹亲手砸碎?

5月5日旧金山的辩论赛上,Transformer联合发明人Łukasz Kaiser为其作品辩护,三位挑战者指出Transformer五死穴。Kaiser称除非新架构证明有更好的scaling曲线,否则Transformer仍是主流,还给出具体辩护。

新智元
产品应用8

Qwen3.8-Max首发上线阿里千问AI平台,API服务与Token Plan同步开放

今日,阿里巴巴发布新一代基座模型Qwen3.8,千问AI平台首发其Max版API服务与Token Plan。Qwen3.8参数量2.4万亿,性能居前列,推理快且能自主编程。API性价比高,平台还为Token Plan用户提供优惠。

阿里云开发者
算法论文8

重复一下提示词,Gemini准确率竟从21%飙升至97%!

Google Research团队研究发现,重复提示词可让Gemini准确率从21.33%升至97.33%。该策略能提升主流模型非推理任务表现,在多模型多基准测试中优势明显,且不增加延迟。

AIGC开放社区
推荐文章8

Astra 的 Computer Use 能力是如何实现的?

本文编译自Browserbase增长工程师Kyle Jeong的个人博客,对比了纯视觉路线Computer Use模型的缺陷,详细拆解Astra模型利用无障碍树结合Codex Harness实现能力的架构、训练方法,分析其优劣与行业价值。

海外独角兽
算法论文8

美团LongCat扎扎实实做了件难事:LLM数学新天花板AMO-Bench

美团LongCat团队联合高校推出AMO - Bench,用50道原创奥赛级难题评估LLM数学能力。它解决现有基准测试痛点,经四重把关构建,测试显示顶级模型表现不佳,也揭示模型提升空间

PaperAgent
推荐文章7

AI工程vs传统工程 —「道法术」中的变与不变

本文从“道、法、术”三个层面对比AI工程与传统软件工程异同,指出AI工程是在传统工程基础上,为应对模型不确定性进行的架构升级,还结合淘宝AI搜索实践提出AI工程应对策略。

阿里云开发者