「AI Agent技术」共找到 11728 篇相关文章
AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT
斯坦福、伯克利、MIT等联合研究,系统评估29个大模型在奥数级不等式证明任务的能力。研究发现,模型答案正确多靠猜,推理漏洞多,参数大、思考久也不能提升推理严谨度,但自我反思和定理线索策略有改善效果。
地表最强AI编码模型Claude 4来了!上线前竟试图勒索工程师,Windsurf 成最大受害者?
今天凌晨,Anthropic 发布下一代 Claude 4 模型,含 Claude Opus 4 与 Claude Sonnet 4,性能大幅提升。但发布前 Claude 4 Opus 测试中常试图勒索开发者。Claude 4 上线引发竞争,Windsurf 遇接入难题。
ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」
现有第一人称视频助手难以自主判断何时介入服务用户。大连理工大学等团队提出Vinci2,含评测基准EgoServe和智能体EgoMemo。它已被ECCV 2026接收,代码和标注均开源。
ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator
来自南京大学NLP实验室的ICML 2026论文指出,当前主流多智能体架构中,系统失败常源于负责全局调度的Orchestrator失去对任务的掌控。论文提出相关框架和方法对其进行分析与评估。
能效翻5倍!他们复刻人脑双记忆通路,造出能长效记住上下文的类脑AI芯片
帝国理工学院博士后孙鹏飞和苏黎世联邦理工博士后苏哲及合作者,受大脑皮层机制启发,打造“双重记忆路径”类脑网络及配套芯片,处理语音识别任务时能效比此前优方案高5倍。相关论文发表在《自然·机器智能》且代码、设计全开源。
画数独、烧蜡烛都不翻车了?浙大&阿里让AI先三思再下笔|ACL 2026
当下视觉生成中,开源模型在逻辑推理生成任务上频频翻车,与闭源模型有差距。浙大与阿里团队提出Unified Thinker,将思考与执行解耦,构建数据集、采用创新算法,实验显示其有效提升逻辑执行准确度。
AI写CUDA算子准确率92%,到国产芯片只剩4%?上交方法直线拉升,DeepSeek也适用
GPT-5.2写CUDA算子正确率92%,给华为Ascend NPU写算子仅4%,因公开数据少等致‘新硬件冷启动’难。上海交大团队EvoKernel不训新模型、不标新数据,将GPT-5.2正确率从4%拉到83%,还拓展到DeepSeek架构算子。
千问App敞开玩,做红楼梦人物图、旅行海报、绘画书法无敌,顶级AI生图模型加持
作者体验阿里发布的Qwen - Image - 2.0模型后分享千问App玩法。可生成趣味信息图,如表情包、旅游攻略图、美食攻略图等;能做复杂文字梗图;还能创作中华文化传播图,如红楼梦解读图、手办图等,该模型懂中文意境。
还在玩AI 3D手办?Gemini 3 Deep Think已能直出STL,可打印实物
推理模型赛道竞争激烈,谷歌 Gemini 3 Deep Think 迎来重大升级,能处理科研级、工程级、多条件约束问题,可将用户要求等建模成 3D 打印实体文件,还能用于多领域科研和工程,欲成科研工程‘第二大脑’。
美团龙猫LongCat技术升级!新注意力机制解码速度快10倍,还能处理1M超长文本
美团龙猫LongCat系列发布全新稀疏注意力机制LoZA,重点解决长文本任务难题。它在MLA机制基础改造,计算复杂度降至线性,处理128K上下文解码快10倍,性能不缩水,后续还计划支持动态稀疏比例。