「大厂AI」共找到 12116 篇相关文章
从DeepSeek-V3到Kimi K2:八种现代 LLM 架构大比较
文章对比了DeepSeek-V3、Kimi K2等八种现代LLM架构。介绍各模型独特技术,如DeepSeek V3的多头潜在注意力和混合专家技术,OLMo 2的后归一化策略,Gemma 3的滑动窗口注意力等,探讨架构改进与突破。
KAG-Thinker:「结构化」思考新范式,支持逻辑严谨的大模型复杂推理
近日,蚂蚁集团知识引擎团队协同高校发布 KAG-Thinker 模型,是 KAG 框架重要迭代。它聚焦复杂推理,建立结构化思考范式,实验显示其性能在多数据集上有提升,还在医疗问答验证了专业领域有效性。
告别盲选LLM!ICML 2025新研究解释大模型选择的「玄学」
弗吉尼亚理工大学研究团队提出 LensLLM 框架,基于 PAC - 贝叶斯泛化界限揭示 LLM 微调性能“双相演进”,可精准预测微调性能、大幅降低计算成本,为 LLM 选型提供新工具。
登上热搜!Prompt不再是AI重点,新热点是Context Engineering
最近「上下文工程」很火,Andrej Karpathy 为其打 Call。它和「提示词工程」不同,是构建自动化系统给模型提供输入。文章介绍了其核心要素、实践方法论,还给出了参考的博客和视频。
一句“Hi”,80$蒸发!O3-Pro:地表最强,也最“坑”的AI!
昨晚ChatGPT宕机,OpenAI 2折甩卖o3模型并发布o3 Pro。o3 Pro编程能力强,达全球top150程序员水准。官方称甩卖的o3是原版但推理快近40%。o3使用成本高,还需足够上下文。
AI青年学霸齐聚杭州!这场峰会要选出「未来科学新星」
2025年6月6 - 8日,2025全球人工智能技术大会(GAITC 2025)将在杭州召开,多位院士带来重磅演讲。6月7日下午,首届“清源学者”前沿交叉峰会开幕,15位青年学者将分享原创成果,展示人工智能应用潜力。
陶哲轩联手AI挑战经典ε-δ极限!加法秒杀、乘法翻车
数学大师陶哲轩第三支Lean 4自动化数学证明视频,携手GitHub Copilot挑战「ε - δ」极限问题。Copilot处理加法较顺,减法卡壳,乘法失控。复杂证明时它短板尽显,陶哲轩认为复杂证明还得靠人脑。
比Sora更疯狂!英伟达AI让机器人「做梦」修炼,无师自通直接上岗
英伟达新研究项目DreamGen用视频生成模型让机器人在神经网络生成的「梦境世界」自主探索学习。它能让机器人掌握新动作、泛化到新环境,合成数据暴涨333倍,还引入DreamGen Bench用于视频生成基准。
AI大佬教你如何中顶会:写论文也要关注「叙事」
NeurIPS投稿截止不到一月,Google DeepMind的Neel Nanda发布机器学习论文撰写指南,旨在解决论文表达晦涩问题。指南涵盖理想论文精髓、写作关键要素、结构解析、流程建议及常见问题应对策略。
AI无师自通,搞定所有家务!π0.5突破泛化极限,UC伯克利系出品
具身智能最大挑战是泛化能力,美国具身智能公司Physical Intelligence推出π0.5 VLA模型,通过异构任务协同训练实现泛化,可在全新家中执行各种家务,虽有不足但向广泛泛化物理智能迈进。