「复杂任务处理」共找到 3153 篇相关文章
Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
公里级场景也能稳住了,国产团队把长视频3D重建又往前推了一步
浙江大学、地平线机器人和之江实验室的新工作 Scal3R 要解决长视频 3D 重建问题。它借助 test - time training 技术,设计全局上下文模块和同步机制,提升长序列重建稳定性和精度,能处理超万帧几千米的场景。
老黄秘密武器曝光:AI一夜设计芯片,顶人类顶级工程师10个月!
英伟达在GTC大会揭露用AI设计GPU,原本8名工程师10个月的任务,AI一夜完成。其开发NB - Cell、Prefix RL等工具,还推出内部大模型Chip Nemo和Bug Nemo,不过完全端到端自动化设计仍有距离。
谷歌开源“Agent Skill 超级工具箱”,云、库、引擎、AI全线打通,开发者狂喜
在大模型竞争白热化背景下,谷歌为解决开发者难题推出 Agent Skills。官方仓库含多项技能,涵盖谷歌云核心服务及架构支柱技能,还提供常见任务流程指南,兼容多平台,能省开发代码。此前还有 Addy Osmani 开源的技能库。
这周六,聊聊具身数据、模型与落地场景|沙龙报名
当下具身智能进入加速期,但具身模型从Demo走向真实世界运行路径复杂,存在技术路线未收敛、数据匮乏等问题。量子位等联合发起沙龙,4月25日周六14:00,一线从业者与研究者将分享经验,探讨具身智能关键环节。
奥特曼亲自上阵,Images 2.0登顶王座!大米刻字,生图跨入GPT-5时代
OpenAI上线ChatGPT Images 2.0,奥特曼称其是从GPT - 3到GPT - 5的飞跃。它是首个‘会思考’的图像AI,能精准听懂中文指令、渲染复杂UI,在Arena榜单登顶,解决了多语言、风格等痛点。
LeCun世界模型:48倍规划速度,单卡就能跑
Yann LeCun团队推出LeWorldModel世界模型,仅靠两条数学规则,让机器几小时学会物理运转逻辑,动作规划速度超同类48倍。它跳出复杂训练修补怪圈,单卡训练,在多环境测试表现出色,还展现对物理法则的深刻理解。
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
当前大语言模型在长周期任务中,长时持久记忆管理陷入“精度不够”和“成本太高”的两难困境。中国人民大学团队提出MemSifter框架,将记忆检索工作外包给轻量级代理模型,在8个权威测试中超越现有方案,且已开源。
还在玩AI 3D手办?Gemini 3 Deep Think已能直出STL,可打印实物
推理模型赛道竞争激烈,谷歌 Gemini 3 Deep Think 迎来重大升级,能处理科研级、工程级、多条件约束问题,可将用户要求等建模成 3D 打印实体文件,还能用于多领域科研和工程,欲成科研工程‘第二大脑’。
天玑9500s正式登场!扩图消除本地跑,《原神》极高画质满帧运行
联发科技发布次旗舰新品天玑9500s,搭载旗舰机NPU,可流畅运行复杂端侧生成式AI模型,还采用3nm制程等,让《原神》极高画质满帧。此外,还推出天玑8500,Redmi Turbo 5 Max将首发天玑9500s。