「哥大团队」共找到 7329 篇相关文章
基于闪电注意力机制,创新高效开源大模型
传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。
Agent记忆系统:6大核心操作全景解读
自LLM进入Agent时代,记忆模块成研究重点。以往研究有缺憾,作者提出全面AI记忆研究框架,对记忆表示分类,引入六种基本记忆操作,并映射到多方面,还阐述各部分具体方法。
刚刚,马斯克终极大招Grok Bot来了!
SpaceXAI发布Grok Bot早期测试版及将发布4.6版本。它是云原生AI Agent,能24小时工作、多Bot并行协作,还能跟班学习。它是600亿收购Cursor的成果,对标Anthropic的Claude Cowork。
感谢 OpenClaw,国产大模型终于知道怎么挣钱了
OpenClaw作为免费开源项目,重新定义Token消耗量级,催生‘超级Token耗散场景’,倒逼模型厂商推出‘Token Plan’。多家国产模型厂商跟进推出‘龙虾套餐’,云平台也下场布局。但OpenClaw面临配置门槛、任务稳定性和必用场景等问题。
谷歌新研究:大模型“吵架”有利于提升推理质量
谷歌新研究发现高级推理模型自发进化出'思想社会',研究人员用LLM - as - judge方法识别出多个虚拟人格。还找到控制现象的'开关',实验表明教AI'吵架'更有效,其'社交技能'通用,给开发者带来新启示。
英伟达开源全新大模型:黄仁勋不想只「卖铲子」
2025年底英伟达宣布开源全新模型家族Nemotron 3,含Nano、Super和Ultra。它融合Mamba、Transformer和MoE技术,有诸多创新。这不仅是产品更新,更是战略突袭,标志着英伟达想构建AI闭环开放生态。
云计算一哥,给 Agentic AI 工程做“减法”
2025 年亚马逊云科技 re:Invent 大会聚焦 Agent,其首席执行官提出未来各领域将运行数十亿 Agent。该公司欲在 Agentic AI 上重构,推出系列工具,如 Amazon Strands Agents SDK、Amazon Bedrock AgentCore 等,还在模型训练和工程化方面做减法。
挑战ReAct!MetaGPT团队提出ReCode智能体新范式
DeepWisdom研究员指出当前主流智能体框架受固定决策粒度束缚,提出ReCode新范式。它统一规划与执行,能在不同粒度间自由切换,实验显示其性能、成本和训练效率均有提升,引发广泛关注。
Ilya罕见发声:大模型「大力出奇迹」到头了
Ilya大神在近2万字采访中称,AI正从「规模时代」走向「科研时代」,主流「预训练 + Scaling」路线遇瓶颈。他还探讨了AI泛化、安全对齐、预训练范式等热门话题,给出独特见解。
大厂CIO独家分享:AI如何重塑开发者未来十年
阿里云智能集团副总裁、CIO蒋林泉分享AI时代开发者发展。他指出不能用旧有标准评判价值,探讨技术贡献衡量、全栈工程师、提效顺序等问题,强调AI可助力学习和角色创新,还提及招人看重的能力和心性。