大模型Agent」共找到 10530 篇相关文章

产品应用8

华为云的组合新范式,引爆了Agentic AI应用革命

在2025全球计算会上,华为云提出Versatile智能体平台与CloudDevice云终端协同方案,致力于破解模型行业落地痛点。该方案激发AI端侧应用可能,释放云端潜力,已在多行业展现变革价值。

机器之心
开源动态7

开源DeepSeek R1增强版:推理效率快200%,创新AoE架构

德国TNG公司开源DeepSeek R1增强版DeepSeek - TNG - R1T2 - Chimera,基于三模型混合开发,采用创新AoE架构,推理效率比R1 - 0528快200%,成本减,在主流测试中性能更好。还介绍了AoE架构构建子模型方法。

AIGC开放社区
算法论文8

让代码接管世界演化,西湖学发布Code视频世界模型

西湖学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。

机器之心
算法论文8

比传统方法强7倍:Anthropic物理隔离危险知识,重塑模型安全训练范式

Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统方法7倍,还能处理未标记危险数据。

AIGC开放社区
算法论文8

EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法

vivo AI Lab 算法团队提出新的模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和模型

机器之心
推荐文章7

Karpathy:我不是要造新词,是「上下文工程」对 Agent 来说太重要了

Andrej Karpathy 认同Shopify CEO关于「上下文工程」的观点。它指为语言模型提供恰当信息和工具,比提示词工程更重要。文章介绍其概念、与提示词工程区别,及写入、筛选等落地策略。

Founder Park
开源动态8

AI不靠“闭门造神”,海内外一线专家共探智能新纪元,GOSIM AI Paris 2025圆满收官!

5月7日,GOSIM AI Paris 2025在法国巴黎迎来第二日议程。全球专家围绕AI技术多方面探讨,涉及模型、基础设施等主题。还分享模型趋势,宣布新型许可证,各分论坛展示多元成果,会圆满收官,杭州场9月待启。

AI科技大本营
开源动态7

Unsloth宣布更新,可免费用强化学习训练视觉模型Qwen2.5-VL-7B

Unsloth宣布更新,支持视觉/多模态模型强化学习训练,含Gemma 3和Qwen2.5 - VL。其独特机制使VLM RL训练速度提升、显存占用降90%等。还引入GSPO算法,能在免费Colab T4 GPU训练Qwen2.5 - VL - 7B。

AI工程化
开源动态7

Qwen又立功,全球最快开源模型诞生,超2000 tokens/秒!

全球最快开源模型K2 Think诞生,速度超2000 tokens/秒,由阿联酋机构与公司合作推出,基于Qwen 2.5 - 32B打造。实测速度快且答案准确,主要为数学推理开发,团队已发布技术报告。

量子位
算法论文8

清华新框架让模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍

清华等团队提出全新框架RAM,受人类阅读认知启发,将“精读+略读”混合策略引入上下文压缩,突破现有方法效率瓶颈,在多任务上表现出色,实现12倍端到端加速,为长上下文LLM部署提供新范式。

量子位