「多模态大模型智能体」共找到 9579 篇相关文章
空间智能新作,影石开源户外全景重建算法
近日,Insta360 研究院联合高校提出 PanoLOG,首个面向全景输入的大规模户外三维重建工作。它解决全景分区难题,在多基准上取得领先渲染质量与小模型体积,还为户外具身智能等提供新思路。
卷不赢模型,Meta改行「算力包租公」!一夜炸崩美股AI链
Meta筹建「Meta Compute」云业务,出售AI算力和模型访问权限,冲击云计算格局。此前Meta为AI砸巨资,模型需求不火,效仿SpaceX出租算力。它有两张牌,还由重量级班子操盘。
哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型
动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。
18岁华人开源成果,火爆具身智能赛道
18岁华人小哥Eddy Xu的初创公司Build AI开源了有史以来最大的人类为中心数据集Egocentric - 10K,含10亿帧画面,规模是同类的100倍,场景扩展至工厂。不过其缺乏多模态信息,且human - centric路线也有局限。
Meta-Think ≠ 记套路,多智能体强化学习解锁大模型元思考泛化
上海交通大学等团队提出ReMA框架,将复杂推理解耦为元思维和推理智能体,通过迭代强化学习协作。在单轮实验中,ReMA在多基准测试表现优;多轮实验虽有提升但不稳定,需进一步探索。
最新视觉大模型 DINOv3论文精读(逐段解析)
DINOv3是突破性自监督视觉基础模型,其创新围绕数据与模型协同扩展、Gram锚定技术、多阶段训练策略。它解决传统自监督学习难题,在多任务上无需微调达最优,为计算机视觉树立新标杆。
14K Star!统御万模的 AI 聚合网关,一个 API 管理所有大模型!
文章分享了AI聚合网关神器New API,它基于Go和React开发,是中转分发系统,像超级转换插头。集成30+模型服务,有多种特性,支持6种部署方式,能收敛混乱的模型调用。
CES 新爆款!追觅具身智能扫地机,打破「人形唯一论」
CES上,追觅具身智能扫地机成爆款,它打破“人形唯一论”,采用四足轮腿和双臂结构,能完成多种家务及养老关怀功能。它基于深厚积累且研发投入高,有望成家庭具身智能优选。
阿里开源Mobile-Agent-v3:多模态GUI智能体,实现跨平台自动化突破!
全新自动化时代,GUI智能体融入日常。阿里巴巴通义实验室推出GUI - Owl与Mobile - Agent - v3,实现跨平台自动化突破。文章解析其发展历程、技术创新,且项目开源,商业化潜力引关注。
从“开放模型”到“开放生态”,AI 开源进入下半场
近期,Meta 推出开放权重模型,而开放模型商业使用收费渐成趋势。AI 开源面临成本、边界等问题,竞争从模型能力转向基础设施选择。世界人工智能开源大赛关注模型应用,凸显开源生态建设重要性。