多任务操作」共找到 5615 篇相关文章

产品应用7

不只是聊天:Gemini Agent Mode 深度集成 Android Studio,可直接修改项目

谷歌为 Android Studio 推出集成 Gemini 的 Agent Mode,在最新预览版上线。它以整个项目为上下文,能直接修改项目、执行步骤任务,可通过 MCP 与外部工具交互,但预览版有不足,谷歌正解决。

InfoQ
算法论文8

与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读长文本

NeurIPS 2025 论文提出 VIST 框架,为大语言模型长文本推理提供视觉方案,与 DeepSeek - OCR 理念不谋而合。它模仿人类阅读,有快 - 慢路径协作,在任务表现优,还让模型‘用眼看文字’,优势明显。

机器之心
开源动态8

LeCun团队开源首个代码世界模型:能生成代码还能自测自修!传统编程模型一夜成古典

Meta FAIR推出全球首个代码世界模型CWM,它能生成代码、理解语义,还‘懂得’代码执行,能模拟运行过程。在个代码与推理任务表现出色,开源代码、训练细节等,不过目前仅支持Python。

量子位
算法论文8

Transformer已死?DeepMind正在押注另一条AGI路线

谷歌团队借鉴人类联想记忆,提出嵌套学习,解决AI「灾难性遗忘」问题。强调优化器与架构协同进化,构建联想记忆系统。HOPE架构在任务表现出色,或开启AI从被动训练到主动进化大门。

新智元
算法论文8

ICML 2025 Spotlight | 快手、南开联合提出模块化双工注意力机制,显著提升模态大模型情感理解能力!

情智兼备是人工智能发展方向,但模态情感数据语义复杂,建模跨模态关联是挑战。快手可灵团队与南开提出模块化双工注意力范式,构建‘摩达’模型,在任务测试中性能提升,成果被 ICML 2025 收录。

AI前线
算法论文8

√N并行+84倍计算加速!英伟达港大全新图像注意力:空间结构都保留

英伟达、港大等研究人员提出新型视觉注意力机制GSPN,通过线性扫描和稳定性 - 上下文条件处理图像空间结构,降低计算复杂度至√N量级,在视觉任务达先进水平,生成16K图像加速超84倍。

新智元
开源动态7

Claude Cowork 解读和 Open-Cowork开源实现

Claude Cowork是Anthropic推出的AI工作代理工具,可操作文件、执行长期任务,现处研究预览阶段。因使用门槛高,GitHub出现开源项目Open - Cowork,零代码门槛、模型支持,有文件管理等功能。

深度学习自然语言处理
算法论文8

一篇120页AI4Research(科学研究AI)最新系统性综述

为填补AI在科学研究应用缺乏全面综述的空白,提出AI4Research调查。其主流流程和分类分五个关键领域,各领域细分任务,凸显AI在研究中样角色,还介绍学科应用。

PaperAgent
算法论文7

The Batch: 931 | 统一视觉媒体的单一分词器

Apple团队开发维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经阶段训练,在任务上达或接近先进水平,为视觉模型带来通用性。

DeeplearningAI
开源动态8

Meta 新成立超级智能实验室,让大模型RAG推理速度飙升30倍

Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在任务测试中表现出色,为大模型部署提供实用方案。

AIGC开放社区