「视觉智能工坊」共找到 3935 篇相关文章
迎接智能体的「觉醒时刻」:EverOS全球公测开启Agent Memory自进化序章
随着主动执行型 Agent 爆发,AI 向自我演化智能体跃迁,但现有 Agent 有诸多痛点。EverMind 团队公测专为自我演化智能体设计的记忆底座 EverOS,它依托核心算法与进化引擎,提升任务成功率,解决多项技术难题。
让大模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026
复旦、创智联合推出RSAgent,让多模态大模型通过多轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在多个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。
龙虾社交上线40天被Facebook收购!俩文科创始人加入超级智能实验室
刚上线40天的AI Agent社交网站Moltbook被Meta收购,两位文科创始人将加入Meta超级智能实验室。Moltbook因人类冒充AI的假帖子爆火,但安全漏洞明显。Meta看中其让AI智能体在线连接的能力,或优先修复安全问题。
Meta视觉基座DINOv3王者归来:自监督首次全面超越弱监督,商用开源
Meta推出并开源视觉基础模型DINOv3,采用自监督学习,首次全面超越弱监督,可生成高质量高分辨率视觉特征。它在多任务表现出色,参数和数据量提升,还构建模型家族,已在多领域产生实际影响。
清华天眸芯团队再登Nature系列期刊封面,类脑互补视觉范式重塑AI感知世界的方式
清华天眸芯团队继2024年《Nature》封面后,最新进展又登《Nature Sensors》封面。此次研究实现系统级算法软件生态飞跃,还开源工具链。成果在多场景有应用潜力,晰见科技推动其产业化。
从沙子到会“思考”的智能材料,张朝阳与物理学家刘若微揭秘世界的底层逻辑
8月12日,张朝阳与刘若微教授围绕“复杂的世界:从沙子到智能”主题,从沙堆、泡沫切入软物质与非平衡统计物理前沿,探讨阻塞相变、低功耗类脑智能材料研究路径及未来潜力,还分享科研感悟。
交互扩展时代来临:创智复旦字节重磅发布AgentGym-RL,昇腾加持,开创智能体训练新范式
强化学习之父指出人工智能迈入「经验时代」,在此背景下,复旦、创智、字节研究者发布 AgentGym - RL 框架。它是全新端到端 RL 框架,提出 ScalingInter - RL 方法,7B 模型经训练追平顶尖商业模型,为 AI 发展注入动力。
统一视觉多模态与多任务!快手可灵与港科大团队发布视频生成模型,加速真实世界理解
港科大、港中文、清华和快手可灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实可控,还实现零样本泛化,在多任务表现优异。
ICLR 2026 | 当视频难以被表征:UCSD、HKUST等机构联合提出FlowRVS,用生成式流匹配重构视觉感知范式
计算机视觉领域传统表征方法在视频处理上力不从心,SGIT AI Lab等机构团队提出FlowRVS,跳出传统桎梏,用生成式流匹配重构视觉感知范式,实现SOTA提升,还展现诸多优势,证明Flow Matching理论普适性。
只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max
现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。