「视觉任务」共找到 2423 篇相关文章
开源白嫖!微软这个开源 Agent,让 AI 帮你点按钮、填表格、跑多步流程(还可跨设备)
微软开源智能自动化框架 UFO,主线是 UFO³(Galaxy 多设备编排)+ UFO²(Windows 桌面 AgentOS)。能将多步任务拆分执行,解决跨应用、多步骤甚至跨设备任务难题,有多种功能亮点。
DeepSeek深夜炸场,开源了一个新项目&论文,V4打前站?
凌晨,DeepSeek开源新项目Engram并公开论文。Engram用可扩展的O(1) N - gram记忆替Transformer早期层节省算力,在多方面实验表现出色,如推理任务增幅大于知识任务,还分析了其机理和系统效率。
告别多奖励跷跷板:Flow-OPD将多教师OPD带入图像生成
中国科学技术大学等机构团队提出Flow - OPD,这是首个将OPD引入流匹配模型的统一多任务后训练框架。它解决了流匹配模型后训练对齐中多任务的梯度冲突等问题,效果良好,未来有多个拓展方向。
不吹不黑,在Agent任务上,kimi 2.6确实让我忘了Claude。
Kimi K2.6发布并开源,代码和Agent能力提升。作者测试发现,它在部署Claude Code源码、网站生成、多智能体任务等方面表现出色,审美提升,思维活跃,还能复刻文档风格,开源释放了前沿编程能力。
细粒度视觉推理链引入数学领域,准确率暴涨32%,港中文MMLab打破多模态数学推理瓶颈
香港中文大学MMLab团队发布MINT - CoT视觉推理方案,解决多模态数学推理难题。它引入特殊Interleave Token,构建专属数据集,采用三阶段训练策略,实验效果全面超越现有方法。
TRAE SOLO 移动端发布!超级 Agent 终于走出了桌面
TRAE SOLO 移动端正式上线,同时 Windows 版本也同步发布,实现手机、PC、Web 三端全量开放且无需邀请码。它能完成多种任务,三端任务信息实时全量同步,设备配对简单,在生产力场景实测效果出色。
程序员必收藏!AutoGPT x 167k star实战指南:AI拆解+插件驱动,源代码一键自动化
AutoGPT 是基于 GPT - 4 的开源自主智能代理,在 GitHub 上超 176K 星,速度超 PyTorch。它能解决复杂任务自动化等痛点,具备持续自动任务等核心功能,还给出使用指南,在同类型项目中领先。
o1 核心作者 Jason Wei:理解 2025 年 AI 进展的三种关键思路
前OpenAI核心研究员Jason Wei跳槽Meta后,在斯坦福大学AI Club演讲,提出理解2025年AI发展的三个核心思想:验证者定律、智能的锯齿状边缘和智能商品化。他认为AI将解决可验证任务,智能成本会趋近零,且各任务发展不均衡。
StereoAdapter:北大首提自监督,适配水下双目深度估计
水下机器人深度感知难题待解,北大等机构提出StereoAdapter框架。它结合单双目视觉,以自监督学习适配视觉基础模型到水下域,设计双阶段结构、自监督训练策略等,实验效果好,未来还将多方面改进。
录屏扒代码、截图改网页!Kimi K2.5把「视觉x代码」玩明白了
Moonshot AI推出最强Agentic模型Kimi K2.5,发布后热度起飞。它实现多功能一体化整合,具备设计审美,支持可视化编辑,推出编程工具Kimi Code。在多项测试中表现优异,还能在办公领域发挥作用,其智能体集群提升了效率。