「环境监听」共找到 478 篇相关文章
魔法原子迎来“春晚时刻”|甲子光年
2026年,魔法原子成春晚智能机器人战略合作伙伴,还举办全球合作伙伴大会。其自研机器人挑战春晚复杂环境,此前全栈自研积累实力,有超亿元订单,靠场景和生态赋能突围,未来需转化技术优势为商业成功。
硅谷一线创业者内部研讨:为什么只有 5%的 AI Agent 落地成功,他们做对了什么?
来自硅谷一线AI创业者数据显示,95%的AI Agent在生产环境部署失败,原因在于围绕模型搭建的脚手架不完善。文章基于研讨会内容,探讨AI Agent构建关键,如上下文工程、安全控制、记忆功能等,并指出待解决问题和未来方向。
这个 AI 产品,给了我久违的惊喜。
作者曾探讨为何此前无出圈客服 Agent 产品,认为做 Demo 易,生产环境可用门槛高。本周阿里瓴羊团队发布企业级客服 Agent,它能处理退款、补发等流程,采用人机分工模式,务实靠谱,有望改善客服行业现状。
7B模型“情商”比肩GPT-4o,腾讯突破开放域RL难题,得分直翻5倍
腾讯混元AI数字人团队提出RLVER框架,解决开放域RL在真实交互中的‘情商’优化困境。经其训练的Qwen2.5 - 7B模型在情感对话基准得分跃升,比肩顶级商用模型,团队还有诸多启发性发现。
文心快码正式发布 AI IDE,生成超 43% 百度新增代码
6月23日,百度副总裁陈洋发布文心快码独立AI原生开发环境工具Comate AI IDE,这是行业首个多模态、多智能体协同的AI IDE。目前文心快码生成代码占百度每天新增代码超43%,在多方面有显著优势。
苹果拆解AI大脑,推理模型全是「装」的?Bengio兄弟合著
苹果最新研究揭示大推理模型(LRM)在高复杂度任务中普遍‘推理崩溃’。即便给予明确算法提示,模型亦无法稳定执行,暴露推理机制的局限性。研究还通过多种实验环境分析了模型在不同复杂度问题中的表现。
一个Skill让DeepSeek V4 Pro超越Fable 5?热门插件被锤了
前两天J-Space凭夸张测试结果刷屏,宣称一份Skill接入Agent环境,能让V4 Pro在多基准大幅提升,部分成绩超Fable 5。但社区复测结果相反,作者未公开完整评测记录,还删质疑帖,引发公开打假。
Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
从日志学习到风洞验证:构建 GPU 集群的 AI Native 稳定性闭环
文章介绍了面向新引入GPU芯片稳定性验证的AI Native治理体系“算力风洞”。其通过厂商环境自动复刻等手段,将新芯片适配效率提升10倍以上。体系分认知、验证、进化三层,形成完整闭环,推动智算集群稳定性建设升级。
Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想
UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。