视觉 - 语言智能体」共找到 4659 篇相关文章

开源动态7

让 AI 像真人一样操控手机完成各种复杂任务

MobiAgent是强大的移动端智能体系统,含智能体模型家族、加速框架、评测基准。能让AI像真人操控手机完成复杂任务,提供开箱即用App,内置经验检索模块可自动优化规划。

GitHubStore
算法论文8

Agentic Web:AI Agents如何重塑下一代互联网,一个到处是待研究与落地的方向

论文《Agentic Web: Weaving the Next Web with AI Agents》描绘颠覆性未来,AI 智能体成“数字代理人”,互联网将从“连接信息”向“执行行动”转变。论文给出构建下一代智能互联网路线图,剖析挑战、展示场景并预警风险。

深度学习自然语言处理
算法论文8

VerlTool重塑Agentic RL的训练生态

当前LLM像‘缸中的大脑’,缺乏与外界互动能力。新范式ARLT兴起,但构建训练框架面临诸多挑战。VerlTool作为统一、模块化、高效的开源框架应运而生,解决难题,在多任务实验表现出色,推动LLM向智能体转变。

深度学习自然语言处理
新闻资讯7

「神经软件」正在到来,人类代码将失去意义!

Lambda Labs CEO Stephen Balaban 在英伟达 GTC 2025 提出神经软件概念,指不再写代码,让大语言模型成软件。它没传统软件的 bug 问题,未来计算机或端到端神经化,虽有争议,但变革在加速。

AGI Hunt
新闻资讯8

Demis Hassabis揭秘世界模型Genie 3的真正意义:为AGI打造无限“虚拟子宫”

Google DeepMind CEO Demis Hassabis与产品负责人深度对谈,爆料将游戏智能体SIMA放入Genie 3生成世界训练,探讨AI从游戏到思考系统的演进、Genie 3意义及AGI评估挑战,还提及与Kaggle合作推游戏竞技场。

AI寒武纪
新闻资讯7

GitHub 推出 AgentHQ,Copilot 生态再扩容

GitHub在GitHub Universe 2025活动上推出AgentHQ,可让开发者在其开发环境创建并部署AI智能体,是Copilot延伸。智能体可处理编码多环节,还与GitHub Actions集成,社区反响褒贬不一。

InfoQ
开源动态8

小扎又开源了:7B实现自监督学习SOTA

Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。

量子位
开源动态8

蜂群Agent来了!openJiuwen社区发布JiuwenSwarm,引领Coordination Engineering新范式

华为支持的 openJiuwen 社区发布并开源 JiuwenSwarm,这是面向多智能体协作的蜂群智能体。它指向 Agent 工程新问题,将关注点从 Harness 引向 Coordination Engineering,还介绍了其设计理念、实战效果等。

InfoQ
产品应用8

拖拽式搭建分布式Agent工作流!Maze让非技术人员几分钟搞定复杂任务

大模型智能体落地有诸多问题,Maze分布式智能体工作流框架可提供一站式解决方案。它是集成分布式执行引擎的全能平台,有四大核心优势,还有可视化工具让非技术人员也能轻松搭建工作流。

量子位
新闻资讯7

靠 AI起飞的千亿市值公司,如今要被AI“卷死”了?股价因GPT-5瞬间逆转、CEO亲承:我负有责任

语言学习平台 Duolingo 推行‘AI 优先’战略,虽遭反对但营收增长、股价上涨。不过 OpenAI 推出 GPT - 5 后,其股价急转直下,CEO 称对公众困惑负责,还被律所调查。

AI前线