「多智能体框架」共找到 7345 篇相关文章

算法论文8

首帧的真正秘密被揭开了:视频生成模型竟然把它当成「记忆体」

UMD、USC、MIT研究团队发现视频生成模型会把首帧当作‘概念记忆体’,将视觉实体存于首帧并在后续复用。基于此提出轻量方法FFGo,用少量例子让模型实现SOTA级视频定制。

机器之心
算法论文8

四足机器人首次同时「思考+走路」,北大提出链式推理MobileVLA-R1

在「大模型+机器人」浪潮中,让机器人既听懂话又走得对、稳很难。北大MobileVLA - R1将链式思考引入四足机器人,在仿真和真实实验中对标强基线实现提升,构建了更具工程可用性的范式。

新智元
产品应用7

从补全到 Agentic Edit:Trae 在代码编辑上的落地与进化

AI 编程助手走向智能化,Trae 团队历经“补全 + Chat → Apply → Builder + Cue”三阶段,解决文件定位、跨文件修改等难题,介绍 Apply 与 Search/Replace 方案适用场景,还将从三方面继续探索。

InfoQ
开源动态7

英伟达Run:ai没做到的,被华为开源方案实现了

传统存储难满足AI需求,存储需向‘智能存储’演进。华为数据存储团队推出系列产品和开源工具链,其Flex:ai对标Run:ai,更开源底层,能解决行业算力痛点,已在医院场景落地。

InfoQ
产品应用8

金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%

2025年6月以来多模态文档解析成前沿课题。MonkeyOCR v1.5是全新框架,在OmniDocBench v1.5等基准上全面突破,复杂表格等场景提升9.7%,采用两阶段解析管道和复杂表格处理方案。

量子位
产品应用8

小红书提出社交大模型RedOne 2.0:兼听、敏行

在SNS内容爆炸式增长的当下,传统SFT训练方法有局限。小红书NLP团队推出RedOne 2.0社交大模型,采用以RL为核心的三阶段渐进式训练方法,实验显示其性能优异,还能转化商业价值。

量子位
开源动态8

识别1600+种人类语言,支持少样本扩展到5400+种语言,Meta自动语音识别模型开源

Meta AI发布Omnilingual ASR自动语音识别模型并开源。它能转录超1600种语言,含500多种首次被AI理解记录的语言,还可通过少样本扩展到5400多种,改变了多语言ASR构建范式。

AIGC开放社区
产品应用8

nndeploy:一款基于可视化工作流的AI部署工具

nndeploy是简单易用且高性能的AI部署框架,可将推理优化转化为可视化工作流,无需前端技术栈。它还提供端侧完整AI部署方案,有多端推理等功能,介绍了使用方法与技术原理。

GiantPandaLLM
产品应用8

AI编程冲刺“DeepSeek时刻”:00后团队用国产模型一键直出复杂应用,效果超越Claude Code

云端Agent有新进展,重新定义AI编程范式。Vinsoo上新Beta 3.0版本,仅用国产大模型就超越一众流行AI编程产品。它解决了4个核心技术问题,还带来三重云端AI Agent新体验,其研发团队由00后主导。

量子位
产品应用7

jiSGLang集成ktransformers:2TB内存运行Kimi K2 Thinking模型

对于内存多但GPU资源有限的用户,SGLang集成ktransformers的CPU内核,支持直接运行Kimi K2 Thinking模型。它无需等量化,还能微调,虽性能与GPU方案有差距,但给用户新选择。

AI工程化