「大规模语言模型」共找到 8204 篇相关文章

新闻资讯7

GPT-5通过“哥德尔测试”!独创性解决博士生都得花几天时间的开放数学问题

最新论文中,研究人员让GPT - 5挑战5个未解决的优化猜想,它解出3个,还对一题给出不同有效证明方案。测试题需博士水平研究者花几天完成,研究还“挑衅”了陶哲轩对大模型数学能力的印象。

量子位
新闻资讯7

DeepSeek刚提到FP8,英伟达就把FP4精度推向预训练,更快、更便宜

DeepSeek提及针对国产芯片的FP8量化设计,引发对大模型量化策略关注。不久后英伟达发力低精度量化,将NVFP4策略拓展到预训练阶段,其方案能解决核心挑战,实验证明NVFP4在大规模训练中可行。

机器之心
开源动态8

GLM4.5之后,智谱又开源GLM-4.5V,实测下来视觉推理能力贼强~

智谱继GLM-4.1V-9B-Thinking、GLM-4.5后,又开源最强多模态推理模型GLM-4.5V,在多模态理解榜单达开源SOTA。它视觉推理强,经测试能助力科研各阶段,还介绍了其架构设计与训练策略。

CourseAI
新闻资讯7

Manus 数月憋大招, 100 个 Agent 并发只为选双鞋?肖弘放话:第一阶段就得先做超贵的 AI!

中国人工智能初创公司 Manus 推出新功能“Wide Research”,可让用户借助多个 AI Agent 同时处理大规模任务。该功能不走“深度研究”路径,架构经优化,计算能力扩展 100 倍,但效果待察。Manus 撤出中国市场,欲借此求差异。

InfoQ
推荐文章7

告别模板时代!妙多VP张昊然:生成式AI如何驱动UI设计的范式革命

在AICon2025上海站,妙多副总裁张昊然分享生成式AI在UI设计领域的影响。他回顾初代生成式UI的‘套模板’技术,讲述技术革新后回归代码生成界面,还探讨让AI理解设计系统、妙多AI 2.0理念及未来UI工具假设。

InfoQ
新闻资讯7

OpenAI资金链告急!紧急启动300亿美金融资,星际之门现在岌岌可危

OpenAI为“星际之门”项目寻求300亿美元融资,该项目由其和软银牵头,总投资可达5000亿美元。但OpenAI与软银在选址和规模上起冲突,软银要求其重组,否则削减投资。OpenAI未盈利,内外危机重重。

量子位
推荐文章8

从DeepSeek-V3到Kimi K2:八种现代 LLM 架构大比较

文章对比了DeepSeek-V3、Kimi K2等八种现代LLM架构。介绍各模型独特技术,如DeepSeek V3的多头潜在注意力和混合专家技术,OLMo 2的后归一化策略,Gemma 3的滑动窗口注意力等,探讨架构改进与突破。

PaperAgent
新闻资讯7

Meta 重金抢人,明星云集就能复制 DeepSeek 的成功吗?

Meta 扎克伯格亲自出手重金招人,组建豪华 AI 战队,核心领导与技术阵容都很强大。但天才招聘只是第一步,组织天才协同才关键。DeepSeek 团队规模小、扁平化,成功逆袭。Meta 难复制其成功,组织重构能力或更重要。

AI科技评论
8

AI 陪伴赛道,会诞生下一个「泡泡玛特」吗? | GAIR Live

AI科技评论组织“AI陪伴”线上圆桌,多位从业者探讨AI陪伴是否伪命题、不同人群接受度、产品核心价值等,还讨论IP对AI硬件的重要性、硬件与软件优势、是否出海等问题。

AI科技评论
推荐文章8

Devin 教你做 Agent:把 AI 当做需要指导的初级开发者

Cognition团队发布编程智能体实践指南,以把AI当初级开发者的心智模型为基础。介绍与智能体沟通原则及融入日常工作流的场景,还分初、中、高级给出任务处理方法,也提及局限性、使用建议和安全管理等内容。

Founder Park