「跨模态任务」共找到 2000 篇相关文章
Agent不会搞科研?人大微软开源框架&工具包解决盲目试错通病,抱抱脸日榜第一
AI智能体虽能完成多项任务,但大多难以自主科研,易陷入盲目试错。人大和微软研究者提出Arbor框架与工具包,借助Hypothesis - Tree对优化空间结构化探索,多方面表现出色,荣登Huggingface日榜第一。
博士学位答辩PPT分享 | Scalable Operation-aware Aerodynamic Design
杨奥博博士毕业于香港科大,长期研究多学科优化方法在飞行器等设计中的应用。其博士论文提出可扩展的、基于任务感知的气动设计框架,贯通关键环节,形成一体化方法体系,有多项创新成果。
Transformer已死?DeepMind正在押注另一条AGI路线
谷歌团队借鉴人类联想记忆,提出嵌套学习,解决AI「灾难性遗忘」问题。强调优化器与架构协同进化,构建联想记忆系统。HOPE架构在多任务表现出色,或开启AI从被动训练到主动进化大门。
实锤了,Meta 正式收购 Manus
近日,Manus 官网官宣“加入 Meta”。Manus 致力于打造通用 AI Agent,能处理复杂任务。这是笔待完成交易,未披露条款。Meta 在 AI 落地应用缺具象答案,收购它或是选已跑通逻辑的产品融入底层。
图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果
百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。
Claude Code 里那些奇奇怪怪的词是什么?
作者用Claude Code调查其处理任务时冒出怪词的原因,发现这些词存于`UK5`对象,有88个动词 -ing 形式,硬编码在客户端。词中有常规、怪词、造词、俚语等,增添幽默。
√N并行+84倍计算加速!英伟达港大全新图像注意力:空间结构都保留
英伟达、港大等研究人员提出新型视觉注意力机制GSPN,通过线性扫描和稳定性 - 上下文条件处理图像空间结构,降低计算复杂度至√N量级,在多视觉任务达先进水平,生成16K图像加速超84倍。
马斯克的 Grok Bot 正在吞掉电脑,买 Mac mini 的事可以先缓缓
重度使用 Codex 大半年,电脑不堪重负,Agent 任务增多让本地电脑成瓶颈。Grok Bot 将 Agent 工作搬到云端,配云电脑,解决本地硬件难题,还为 Bot 分配独立屏幕,实现人机电脑分工。
谷歌AGI底座降临!首个原生全模态嵌入模型上线,已实现全模态SOTA
谷歌发布首个原生全模态 Embedding 模型 Gemini Embedding 2,将文本、图、音视频及 PDF 融于统一向量空间,实现跨模态检索,降低架构成本,赋予 AI 连贯「记忆」,是重塑 AI 基建的里程碑。
Claude Cowork 解读和 Open-Cowork开源实现
Claude Cowork是Anthropic推出的AI工作代理工具,可操作文件、执行长期任务,现处研究预览阶段。因使用门槛高,GitHub出现开源项目Open - Cowork,零代码门槛、多模型支持,有文件管理等功能。