大模型预训练」共找到 9494 篇相关文章

新闻资讯7

DeepSeek流量暴跌?AI模型全球霸主离奇遇冷,外媒曝出真相

曾以低价高性能出圈的DeepSeek,在自家平台遇冷、市场份额下滑,但其R1和V3模型在第三方平台使用量增长近20倍。背后是‘Token经济学’及战略转移,它开源模型,将算力留作研发。Anthropic也因算力受限有类似问题。

新智元
算法论文8

ICML 2025 | 注意力机制中的极值:破解语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
产品应用7

Web 开发 AI 就选它?V0复合架构无错误率 93.87% 远超 Claude 4 Opus 单体!

Vercel推出新AI模型v0系列,采用复合模型架构,将RAG专业知识、SOTA模型推理能力和定制流式后处理模型结合,能提升代码生成质量,且基础模型升级时可快速替换,还训练了定制AutoFix模型

AI进修生
新闻资讯7

o3-pro通关“推箱子”,人类怀旧小游戏成了模型新Benchmark

推箱子、俄罗斯方块等经典小游戏成模型benchmark,o3 - pro挑战这两款游戏表现出色,突破benchmark上限,成绩远超o3。Lmgame含多款游戏,有不同评价方式,且开源可用于模型测试。

量子位
新闻资讯7

一个“蠢问题”改写模型规则!Anthropic联创亲曝:瞄准Claude 5开发爆款应用,最强模型的价值会让人忽略成本负担

Anthropic联合创始人Jared Kaplan在YC分享Scaling Law对模型发展的影响及对Claude等模型的意义。他认为AI发展不平衡,建议构建未完全跑通的产品,还介绍了Claude 4优化,探讨人机协作等内容。

InfoQ
开源动态8

谷歌版小钢炮开源!0.27B模型,4个注意力头,专为终端而生

谷歌开源Gemma 3 270M,几分钟就能完成微调,性能超Qwen 2.5同级模型。此模型小巧高效,可本地运行,还能用它构建OCR应用。它有多项亮点,适合多场景,上手简单。

量子位
开源动态8

Qwen-AgentWorld:一个语言世界模型,模拟七Agentic领域

今天正式发布 Qwen-AgentWorld,它是首个原生语言世界模型,能在七领域模拟智能体交互环境。同步发布 AgentWorldBench 评测基准。Qwen-AgentWorld 经三阶段训练,在评测中表现出色,还探索两种范式增强通用智能体能力。

千问大模型
新闻资讯8

刚刚,智谱港交所敲钟!市值528亿港元

智谱在港交所敲钟上市,成全球首家AGI基座模型上市公司,首日市值超528亿港元。其IPO受热捧,资本阵容强。新一代模型GLM - 4.7表现出色,营收增长快,部分资金用于研发,标志中国模型迈向全球竞技。

量子位
算法论文8

ICML 2025 | 注意力机制中的极值:破解语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极值,V表示无此模式。研究通过实验明确极值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
新闻资讯8

苹果放王炸!开放模型访问权、全家桶集成ChatGPT,人人能开发AI应用

苹果在“WWDC 2025”会宣布在多设备集成Apple Intelligence功能,含ChatGPT图像生成等。开放基础模型访问权,开发者可开发适配应用。新功能将逐步开启测试,今年秋季部分用户可用。

AIGC开放社区