「复合模型架构」共找到 8514 篇相关文章
Hermes Agent 技术深度拆解:36000 Star 背后的架构设计,以及你该怎么用它
Hermes Agent 9 个月获 36800 Star,解决记忆断裂、能力天花板和平台绑定问题。它有四层记忆架构、自主技能进化,支持 200+ 模型,还有 40+ 内置工具、15 个平台适配器。最新 v0.8.0 版本有多项更新,文章还给出使用建议和对比。
将思维链(CoT)引入具身世界,哪种路径能真正打通机器人「知行合一」?
文章围绕将思维链(CoT)引入具身智能领域展开。介绍CoT从语言层面到成为机器人行为核心认知机制的转变,分析分层架构与端到端模型两种技术路径,还阐述自变量机器人统一架构的优势和能力。
迈向AI4S 2.0,上海AI实验室开源书生万亿科学大模型Intern-S1-Pro
2月4日上海人工智能实验室开源万亿参数科学多模态大模型Intern - S1 - Pro,为AI4S迈向2.0提供开源基座。其核心科学能力跃升,底层架构创新,科学与通用能力协同发展,还构建了‘算力 - 算法’一体化基座,推动科研范式革命。
LeCun发布最新世界模型:首次实现16秒连贯场景预测,具身智能掌握第一视角!还打脸用了VAE
LeCun团队推出PEVA模型,让具身智能体学会人类“预判能力”,首次实现16秒连贯场景预测。它结合结构化动作表示与条件扩散Transformer,用真实数据训练,解决长时序问题,还能筛选最优动作。
我在哪?要去哪?要怎么去?字节跳动提出Astra双模型架构助力机器人自由导航
当今机器人导航系统在复杂室内环境面临挑战,字节跳动研发创新双模型架构Astra,含Astra - Global与Astra - Local子模型。经实验验证其性能佳,未来有广阔应用前景,但也存在需改进之处。
ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化
NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。
世界模型混战,Momenta率先冲刺IPO
当下世界模型是AI领域热门且混乱的概念,主流路线有四类。Momenta的R7世界模型已量产,其CEO定位公司为物理AI基座模型构建者。Momenta率先冲刺IPO,商业模式正转型,为后续玩家提供价值评估体系。
MiniMax-M1:全球首个开源超长上下文大模型,超越DeepSeek-R1,推理成本仅1/4
MiniMax-M1是全球首个开源超长上下文大模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。
比Claude效果更好、且便宜近 100 倍?xAI祭出“白菜价”AI编码模型掀桌子!网友:便宜没好货
xAI 推出编码助手模型 Grok Code Fast 1,采用新架构,有强大全栈开发能力。价格低,在性能与成本间取得平衡。用户评价不一,它在日常开发场景性价比高,与其他竞品各有优势。
Anthropic神话模型发布,但不让你用
Anthropic发布神话模型Claude Mythos Preview却不开放使用,发起玻璃翼计划联合科技巨头用该模型修复全球软件漏洞。此模型能自主发现众多零日漏洞,合作伙伴应用后强调跨行业协作应对网络安全挑战。