「学习提升」共找到 3938 篇相关文章
英伟达MoE新开源:一行import,微调加速3.7倍
英伟达开源NeMo AutoModel,基于Hugging Face Transformers v5,不改代码API,添一行import就能更快速微调MoE模型。实验显示,它能提升3.4 - 3.7倍训练吞吐,减少29% - 32% GPU显存占用。
Karpathy投了一家AI记忆公司,撞名DeepSeek Engram记忆架构
新公司Engram完成9800万美元融资,投资人有Andrej Karpathy等。它想为AI构建能持续学习的“记忆层”,解决模型吸收组织内部知识问题,首个产品是面向Agent的API,已与多家合作。
端侧跑大模型,现在也太简单了
作者Vicki Boykis分享本地运行AI模型体验,指出如今本地模型性能提升大,像GPT - OSS、Gemma 4系列表现出色。还介绍运行本地智能体流程的设置,虽有问题,但优势多,生态值得投资。
一夜之间,Claude成我同事了
今天凌晨,Claude Code 迎来重磅更新 Claude Tag,可让 Claude 以团队成员身份加入用户团队,在 Slack 平台使用。它具备持续记忆、主动介入等能力,有多人共享、持续学习等优势,企业客户可试用。
全员本科生!何恺明组新作:文生图,258M参数就够了
何恺明携本科生团队推出文生图模型MiniT2I,基于MM - JiT架构,仅用258M参数实现不错效果,训练成本低。该架构删繁就简,去掉VAE和AdaLN等模块,性能提升,展现出与工业级模型的竞争力。
谷歌辞职、创业失败、重读神经科学,她说 AI 时代最危险的事是外包你的思考 | 万有引力
本文是对神经科学家 Anne - Laure Le Cunff 的采访。她分享谷歌工作、创业失败后转读神经科学的经历,阐述“小实验”理念,对比“小目标”,给出 PACT 框架,还谈 AI 使用、科技焦虑等问题。
把VLM塞进隐式世界模型,小鹏机器人新框架让机器人长出物理直觉
机器人大脑架构中VLM和VAM路线各有短板,香港大学、小鹏机器人等团队提出DIAL框架,让VLM在原生特征空间做隐式世界建模,解耦认知决策与底层执行,在机器人部署中表现优异。
大规模工程支撑场景下的多智能体系统设计:Grab 实践案例
Grab分析数据仓库(ADW)团队推出多智能体AI系统,处理数据仓库故障排查等工程请求,减少重复性运维。团队搭建多智能体架构,整合工具生态,考虑安全治理,解决上下文管理挑战,提升工作效率。
基于浏览器请求录制与AI代码生成的E2E接口自动化测试实践
文章以阿里云DataWorks为例,介绍通过浏览器录制插件捕获请求数据,结合AI编程工具生成接口封装与测试用例,解决复杂平台自动化测试难题,对比传统与新范式,剖析新范式优势、协作机制等。
估值315亿!田渊栋AI创业,谷歌、英伟达和AMD参投
Meta离职的田渊栋官宣创业,成立RSI,获6.5亿美元融资,估值约316亿。8位联创阵容豪华,团队致力于构建开放式架构,让智能体自主学习升级,目标打造具5万博士能力的智能系统。