「大模型推理系统」共找到 9130 篇相关文章
Multi-Agent 的灵活编排之路
文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。
Transformers来到了v5时代:从工具包到真理之源,AI时代的操作系统内核的极简进化论
Transformers v5发布,通过极简定义和极致互通成AI生态核心。它做减法重构代码、拓展训练流程、成推理引擎弹药库、提升量化为核心功能,连接训练、推理与部署,是AI生态通用语言。
AI真的能读懂人心吗?阿里通义最新研究成果揭示答案
文章聚焦多模态推理问题,如全局上下文理解不足和推理捷径问题。介绍阿里通义HumanOmniV2改进方案,涵盖全局上下文理解等方面,还详述冷启动、两阶段强化学习训练方案及数据集下载和训练方法。
告别直接生成,文生图进入Agent时代:港中文联合伯克利开源Gen-Searcher
过去文生图多是‘直接出图’,遇真实世界知识等易翻车。港中文等团队提出Gen - Searcher,让图像生成模型像Agent一样搜索等,数据、模型和代码均已开源,实验显示它提升了生图准确性和质量。
百度Qianfan-VL,发票/图表/合同等PDF识别94.75%刷新纪录!
当前主流视觉 - 语言模型在企业级应用有难点,百度千帆团队提出Qianfan - VL系列多模态大模型,在通用和企业级任务表现出色,基于自研芯片训练,还提供框架与管线降低成本。
OpenAI一个月跑4名高管!前COO离场,安全线几乎被一锅端
OpenAI近期人事变动频繁,前COO Brad Lightcap宣布离职,称想做新东西。近一个月内,伦理、未来学、安全系统主管也纷纷离开,安全线几乎被一锅端,同时还面临安全争议,最强模型Astra发布推迟。
DeepSeek V3.2爆火,Agentic性能暴涨40%解密
文章解密了DeepSeek V3.2 Agentic性能暴涨40%的原因,即采用交错思维链机制。还对比了其与早期ReAct范式,介绍其效果、原理,以及MiniMax为落地该机制做的工作,最后提到多家模型达成技术共识。
英伟达Jim Fan:「世界建模」是新一代预训练范式
英伟达机器人主管Jim Fan判断,继“下一个词预测”后,世界建模将成新预训练范式,2026年大世界模型将为多模态AI奠基。他还讨论世界模型定义、应用,展望新推理形式,业内人士也各抒己见。
GitHub 1.3k 一款能“填色回忆”的神器:DDColor 让老照片鲜活又逼真
DDColor是阿里达摩院团队提出的新一代图像自动着色模型,基于双重设计,能实现高保真、真实感强的黑白图转彩色图。它兼容多种类型图片,有诸多核心功能,相比传统模型优势明显,应用场景广泛。
奥特曼瘫坐叫停“GPT-6”训练!太强触发最高安全警报
OpenAI因模型或具网络攻击能力及此前入侵事件,全面升级研究环境安全。暂停模型训练,进行工作负载、网络隔离和安全测试,还扩展监控系统。期间推进对齐研究,未来用AI护AI,升级监控。