「长任务时代」共找到 3501 篇相关文章
仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!
剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。
14k颗星!你的电脑屏幕,正在成为AGI的“眼睛”!这款开源神器让你一键记录所有操作
介绍开源项目ScreenPipe,它是跨平台桌面数据抓取API,能全维度记录数据,有沙盒化插件系统等功能。因能为AGI提供数据、对开发者友好而火,还给出安装和创建插件命令,称其有成为AGI时代“现实采集器”的野心。
中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!
近日,中国科学院等全球顶尖机构发布手术视频原生基础模型SurgMotion。它依托全球最大手术视频数据集,首次突破十亿级参数,覆盖17项核心手术任务,性能卓越,还在多领域形成生态共鸣。
打字太慢?2026年开发者语音输入终极指南:12款工具横评,找到最适合你的那一个
文章是 2026 年开发者语音输入工具横评。指出 AI 编程时代语音输入成刚需,介绍 12 款工具优缺点、适用场景和价格,还给出使用技巧,作者分享自己的选择组合。
除了AGI已来和死亡,我们为黄仁勋重磅访谈总结了50条AI最前沿判断
2026年3月23日黄仁勋在播客访谈提出众多前沿判断,如AGI已来,Agent时代开启;智能会成商品,人性才稀缺;推理成本高;合成数据非旁门左道等,还谈及公司架构、算力、供应链等话题。
从视觉出发统一多模态!颜水成团队最新研究:不再把图像编解码器塞进LLM|ICLR'2026
NVIDIA研究员Jim Fan称AI正经历第二次预训练范式转移。颜水成团队Muddit模型从视觉先验出发,用离散扩散框架统一文生图、图生文和VQA,挑战多模态“语言中心论”,在多任务表现出色。
阿里Qwen-Image-2.0图像生成与编辑巅峰汇合,超真实、超强图文结合
阿里Qwen - Image - 2.0将生图与编辑能力合二为一。它支持长指令,能精准渲染大量文字,引入物理逻辑让文字呈现真实质感,在生图和编辑上对语义理解和画面重构能力强。
OpenAI 发布新的 Codex 桌面版,我现在不骂 Codex 难用了
OpenAI发布Codex Desktop App,是macOS桌面应用。它有图形界面,支持定时任务、Skills管理和多Agent并行运行。还对比了与Claude Code的差别,介绍了OpenClaw项目,最后说明不同用户的使用场景和用量定价。
重磅!OpenAI深夜发布ChatGPT Agent:AI打工人正式上线「附发布会全程视频」
OpenAI推出ChatGPT Agent,它整合Operator远程浏览器和Deep Research能力,Pro、Plus和Team用户可激活。能完成复杂任务,有强大工具集,性能在多基准测试超人类,但OpenAI因能力增强启动最高安全保障。
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni
openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。