「操作规划模型」共找到 8266 篇相关文章
刚刚,Cursor又分享了数百Agent并发协作的最佳实践
Cursor分享数百Agent并发协作最佳实践,讲述单个Agent局限,介绍从多方面探索协同方法,如规划者与执行者分工,还展示多个实验成果,总结模型选择等经验,指出多智能体协同仍待优化。
北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”
北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。
黄仁勋CES回应全场!内存卡了GPU脖子,游戏玩家可能只能用旧显卡了
在CES 2026上,黄仁勋围绕物理AI发言,涉及机器人、自动驾驶等。他预计今年有类人机器人,推出自动驾驶模型Alpamayo 1。因内存成本和供应问题,或复产旧显卡,还谈了AI对游戏影响及内存规划等。
颠覆搜索引擎,下一代Agentic Deep Research!12家顶尖学术机构联手提出
在信息获取方式变革背景下,12家顶尖机构联合发布论文提出Agentic Deep Research,它由大模型驱动,可自动规划检索路径等,或颠覆传统搜索范式,且有基准成绩和TTS Law支撑,开源生态也在聚焦。
众所周知视频不能P?北大施柏鑫团队、贝式计算CVPR研究:视频里轻松换衣服、加柯基
视频编辑难度高,传统流程繁琐,现有AI方法有局限。北大施柏鑫团队联合贝式计算等提出VIRES方法,能实现视频主体多种编辑操作,还标注VireSet数据集。其在多指标超现有SOTA模型,团队还探索全景级可控视频生成。
AI Agent 距离真正替人「全自动办公」,还有多远?
Meta、微软和 xAI 被曝监视员工操作来训练 AI,原因是真实办公中 AI Agent 表现不佳。SaaS - Bench 评测显示顶级大模型表现糟糕,智能体存在长周期任务脆弱、跨应用错误放大等问题,未来 SaaS 软件或需为 Agent 重新设计。
龙虾再进化!强化飞书表格技能,25.2万星登顶超越React/Linux
OpenClaw 2026.3.1正式发布,合并九十多个PR。其Star飙升至25.2万颗,超Meta的React登顶GitHub。更新核心卖点有二:模型武装升级,安卓节点玩法扩容;对国内使用更友好,可在飞书文档操作,Web UI支持双语。
AI 原生应用全栈可观测实践:以 DeepSeek 对话机器人为例
本文以 DeepSeek 对话机器人为例,介绍 AI 原生应用架构可观测需求、挑战与方案实践。分析 AI 领域痛点,提出阿里云 AI 全栈可观测架构,剖析大模型应用可观测技术,分享实战案例,还给出未来规划。
「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了
近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。
Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识
Meta推出「自由Transformer」新模型,打破自2017年以来GPT模型核心规则,在解码器引入潜在随机变量Z,增加“潜意识”。仅增约3%计算开销,在多测试中超越大规模模型,或开启后自回归时代。