「模型能力连续体」共找到 9143 篇相关文章

推荐文章8

为什么今天造大模型的人,一半在学物理

文章指出在AI前沿,不少定义方向的人出身物理。物理训练赋予的品味与做AI的方法论高度重合,体现在统计力学与神经网络、对普适规律的信仰等方面,还提到Scaling Laws最能体现这种品味。

五源资本 5Y Capital
推荐文章7

AGI 路线图第二阶段:游戏即模型训练|AGIX PM Notes

文章围绕AGI展开,介绍AGI路线图第二阶段“游戏即训练”,指出游戏是训练agent的理想环境;还提及Dreamer系列研究进展。同时涵盖本周市场动态、多家公司AI动态及ETF复制指数的方法、优劣和影响。

海外独角兽
推荐文章8

吴恩达深夜发文:GenAI 时代应用工程师的必备能力清单

吴恩达发文剖析GenAI应用工程师这一新兴职业。指出其技能要求与传统软件工程师不同,强调掌握多种AI积木块、利用AI辅助编程工具的重要性,还提及产品技能是加分项,并给出面试关键问题。

AGI Hunt
新闻资讯7

全球云数据库巨头收购Crunchy Data,增强AI Agent能力

全球云数据库巨头Snowflake宣布收购Crunchy Data,发布新型Postgres数据库Snowflake Postgres,满足企业级AI和事务系统需求,具有安全合规等特点,有三大特色功能,推动其成为企业数据负载目的地。

AIGC开放社区
新闻资讯8

刚刚,OpenAI开放GPT-4.1,100万上下文、代码能力超强

今天凌晨1点30,OpenAI宣布开放GPT - 4.1,可在ChatGPT中使用。它针对编码任务,支持100万tokens上下文,在多项测试中表现优于前代,价格更优,不同用户将陆续获得使用权限。

AIGC开放社区
开源动态8

DeepSeek开源的文件系统,是如何提升大模型效率的?

2月28日,DeepSeek开源高性能分布式文件系统3FS以解决人工智能训练和推理挑战。介绍了分布式文件系统优势,深入解读3FS的组件、CRAQ协议等,还探讨其与其他系统差异及性能相关问题。

机器之心
产品应用8

AI 数据平台,要补的恰恰是“模型不知道的事”

本文针对企业落地AI Agent遇到的知识口径不一、推理慢、风险不可控等痛点,介绍华为AI数据平台三大升级路线,结合案例说明方案价值。

InfoQ
算法论文7

Transformer上限触顶,Mobius能否引发下一代模型架构的革命?

自ChatGPT问世,Transformer上限备受关注。前OpenAI、Google负责人称其走到尽头。国内改进架构受算力限制。上海人工智能实验室的书生Mobius团队提出分离知识与推理的架构,有望解决商用等关键问题。

机器之心
推荐文章8

Life of a Token:像调试代码一样看懂大模型如何生成 Token

文章类比 Chrome 的 Life of a Pixel,追踪 LLM 里 token 从输入到输出的全程。以 GPT - 2 Small 为例,详细讲解其管线各阶段,如 Tokenization、Embedding 等,还介绍了残差流、KV Cache 等概念及 GPU 性能瓶颈和优化方法。

AI前线
算法论文7

让大模型指哪打哪的Multi-Agent路由新范式

随着MCP生态兴起,一个Assistant背后可能挂数百工具/子Agent,传统检索方式有成本高、埋没工具等问题。作者提出Tool-to-Agent Retrieval新范式,实验显示指标全面提升,证明工具细节能补足语义。

PaperAgent