「智能体架构」共找到 4848 篇相关文章
阿里新研究:统一了VLA和世界模型
阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。
微软与OpenAI“爱恨情仇”迎来终局:就等OpenAI宣布实现AGI
微软与OpenAI签订新最终协议,在投资架构、IP权益与AGI条款上有重大更新。如微软持股比例调整,多项IP权益变化,OpenAI在合作、研发等方面限制放宽,等OpenAI宣布实现AGI。
用 Warpgate(5.8k star)在不装客户端的情况下,如何实现透明审计、统一堡垒与会话回放?
Warpgate 是完全透明的 SSH / HTTPS 等堡垒解决方案,无需额外客户端。能部署在 DMZ,提供会话录制等功能,以单一可执行文件发布,用 Rust 编写。文章介绍其痛点场景、功能、架构、上手步骤、应用场景等。
2025乌镇峰会看点:人工智能,中国数字世界秩序之巅
2025年世界互联网大会乌镇峰会是战略转折点,议程、展览等聚焦AI,从宽泛论坛变为展示AI驱动发展模式平台。报告剖析议程架构、战略差异,评估其对全球AI格局等多方面的影响。
23.6K star!微软AI项目硬核开源,带飞你的电脑!
微软开源项目 `OmniParser` 是超级智能“数字助手”,能像人一样“看懂”屏幕元素并操作。它精准识别小图标、响应快、开发便捷、兼容大模型且跨平台,目前在Github获23.6K star。
腾讯重磅开源:端到端文档转换VLM,中英文错误率双料最佳!
腾讯开源端到端文档转换视觉模型POINTS - Reader,可将文档图片转结构化文本。它基于POINTS1.5架构,支持中英文。在OmniDocBench基准上,中英文错误率暂列最佳,具零后处理简单等亮点。
AI圈“集体开大”!DeepSeek、Claude带头,智谱、阿里、蚂蚁、智源都“卷”起来了
双节前最后一天,AI圈“卷”疯了!智谱发布并开源GLM - 4.6,是国内最强Coding模型;阿里介绍视、听、说全模态同传大模型Qwen3 - LiveTranslate - Flash;蚂蚁开源万亿参数推理大模型Ring - 1T - preview;智源开源跨本体基座大模型RoboBrain - X0。
「从追赶者到引领者,路有多远?」 我们和CANN一线开发者聊了聊
AI浪潮下,硬件竞争转向软件等生态之战,华为昇腾及其CANN站在变革前沿。本文与开发者对话,探讨CANN开源意义、早期挑战、演进及未来战略,开源将带来技术透明、生态赋能等红利。
苹果传统强项再发力,视觉领域三种模态终于统一
苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。
AI 项目总踩坑?小团队、渐进研讨带你找到正确打开方式
Cloud Native Summit 2025奥克兰大会探讨企业借Open Practice Library将协作模式转化成果。Andrea Magnorsky分享Byte - Sized Architecture方法,Ahilan Ponnusamy与Andreas Grabner介绍企业采用AI的迭代式框架,强调小规模持续研讨。