「LLM 模型」共找到 8118 篇相关文章
吴恩达年终总结:2025是AI工业时代的黎明
吴恩达发表2025人工智能年度总结与公开信。总结指出,今年推理模型性能提升但有成本,AI人才争夺激烈、薪酬高,数据中心建设投入大,智能体让编程更高效。信中建议通过学课程、动手实践和读论文构建AI系统。
UNC | 发布Bifrost-1,构建“最强大脑”与“顶级画师”的桥梁,低成本实现“文生图”自由
随着AI发展,打造能推理又能创作的系统成为焦点。但让LLM学习视觉创作面临训练成本高和能力受损问题。BIFROST - 1框架在MLLM和扩散模型间建通信信道,解决核心痛点,实验表现出色。
首个地球科学智能体Earth-Agent来了,解锁地球观测数据分析新范式
上海人工智能实验室与中山大学联合研发的 Earth - Agent 解决了多模态大语言模型用于地球科学研究的痛点。它将领域知识工具封装化,利用 LLM 智能规划调度。经 Earth - Bench 评估,其在多方面表现出色,未来发展前景广阔。
RL成本降幅超90%!Meta提出Agent训练新范式DreamGym
传统强化学习(RL)训练LLM Agent面临成本高、任务多样性不足等挑战。Meta团队提出DreamGym框架,以经验合成为核心,通过三大组件协同工作,在多种任务和模型上提升性能,为通用Agent训练开辟新路径。
吴恩达来信:AI工程技能图谱详解——构建和部署AI应用
吴恩达在信中详细展开AI工程技能图谱中构建和部署AI应用这一项,介绍需了解的技能,如LLM基础、用数据为模型提供依据等,并阐述各技能要点,还提及构建AI系统与传统软件的区别。
谷歌大脑之父首次坦白!茶水间闲聊引爆万亿帝国,AI自我突破触及门槛
AI界传奇Jeff Dean在「登月播客」深度访谈中,回顾个人成长、Google Brain早期故事及AI未来思考。他揭秘诸多细节,还谈到神经网络发展、注意力机制突破、LLM可解释性等内容,也提及未来五年规划。
ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍
LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。
智能体的记忆管理机制及其潜在风险 | 直播预约
大语言模型(LLM)智能体兴起,记忆机制是核心。本次报告将探讨记忆管理对其性能的影响及潜在风险,展示缓解关键挑战的策略,介绍新攻击范式,揭示安全漏洞,强调需重新审视与建模。
无需人类插手!AI战队自主进化,人类玩家瑟瑟发抖
论文《Agents of Change: Self - Evolving LLM Agents for Strategic Planning》以桌游《卡坦岛》为“考场”测试AI战略能力。研究团队设计四代AI特工,实验显示能自我进化的AI完爆静态AI,不过也存在计算成本高、依赖基础模型等问题。
R1/Qwen训练新范式:无需继续训练,直接“算”出权重,提效500%
DeepSeek - R1爆火让RLVR成大模型后训练焦点,但训练代价高昂。学者发现RLVR中LLM权重和输出概率呈线性变化,提出“权重外推”等方法,实现最高6.1倍训练加速,RL - Extra在多榜单展现高效率。