「智能体任务」共找到 4927 篇相关文章
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。
NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则
文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。
以企业AI为支点,中国软件撬动了全球ToB数智市场
全球围绕GenAI开展融资和市场开发,中国软件企业迎来出海新机遇。用友作为特殊代表,既是参与者也是‘吹哨者’。其全球化业务升级,与多企业双赢,且凭借数智能力能与国外巨头竞争。
支付宝 AI 出行助手高效研发指南:4 人团队的架构迁移与提效实战
本文介绍支付宝AI出行助手研发历程,其集成多种出行功能,基于xUI + KMP框架搭建。分享研发实践、挑战与策略,如迁移基础能力、卡片生态,适配标准框架,还提及KMP应用及数据度量体系,取得业务和研发效能成果。
国产LLM大爆发的一周,Hugging Face热榜被承包了!
这一周国产开源LLM集中爆发,GLM - 4.5、Qwen3的5连发、Step3等接连发布。GLM - 4.5是新一代开源SOTA模型;Qwen3各版本在不同能力上提升显著;Step3是多模态推理模型;腾讯还发布了混元3D世界模型1.0。
The Information:揭秘 OpenAI GPT-5 崎岖的研发之路
The Information揭秘OpenAI GPT - 5研发困境,今年OpenAI遇技术难题,o3等模型研发受阻,内部有分歧。不过GPT - 5在编程等方面有提升,虽难与早期飞跃相比,但改进仍有价值,公司还在开发‘通用验证器’。
重塑浏览器!微软在Edge加入AI Agent,自动化搜索、预测、整合
今天凌晨微软官网宣布在浏览器Edge中加入Copilot模式,它像多层级混合智能体,能自动执行搜索、整合等操作,有标签筛选等创新功能,可提升效率,还保障隐私安全,已免费开放。
字节跳动刚把自己招牌AI Agent开源了,可商用、超6000颗星
字节跳动招牌AI Agent扣子(Coze)开源且支持商用。它是开发平台,提供大模型、工具与开发模式,可视化一站式开发,有上百种模版,还介绍了无代码开发客服智能体的步骤及功能。
GuardAgent:首个专门为LLM agent提供安全Guardrail 的守卫型agent
近年LLM从对话工具变为可自主执行任务的agent,但带来安全隐私挑战。传统安全监护对其力不从心,为此学者发布GuardAgent,它守卫agent,具通用性、精确判断和免训练部署优势,实验表现佳。
豆包 1.6发布后,我用火山引擎Trae + MCP,仅半天做了一个“秒懂科研”的PaperAgent!
文章介绍用火山引擎Trae + MCP和豆包1.6构建“秒懂科研”的PaperAgent。对比其与传统开发范式,突出前者高效、低成本优势,还展示了PaperAgent技术栈及开发过程,体现AI云原生开发魅力。