「视觉推理功能」共找到 3985 篇相关文章
OpenAI的Atlas,全网都没有提到的产品细节在这
作者本期待Gemini 3,结果体验Google AI Studio产品后觉得拉胯。此时OpenAI发布Atlas,作者体验后细节感满满,将其设为默认浏览器。文中介绍了Atlas负责人履历及诸多用户体验细节,也指出其功能尚不完善。
Yann LeCun放出憋了20年的大招:Meta开源V-JEPA 2世界模型
Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。
V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间
近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。
腾讯Omega:下一代“AI BI”的答案?
本文介绍腾讯 Omega,它是为解决传统 BI 和 ChatBI 问题而设计的数据分析产品。Omega 能理解业务问题,生成完整 Dashboard,确保数据流动、安全和稳定,还支持人机协作,提供审美基础设施,性价比高,有完善运行时和监控推送等功能。
对话蚂蚁吴伟:训推一体池化调度,如何把GPU用到极限
AICon大会前,与蚂蚁集团吴伟深度对话,探讨GPU资源调度解法。他指出CPU和GPU有结构性差异,只在推理或训练内优化有资源闲置,国产卡缺全链路生态,软件优化有天花板。还分享架构思路、算法及落地效果等。
昨晚,OpenClaw大更新,亲手终结「旧插件」时代
昨晚OpenClaw重大版本更新,内容多到需单独做目录梳理。重点在ClawHub插件市场、多模型支持等。最重要变化是插件生态重心转向,且体系大改、工具能力收敛,还在多方面有更新,创始人指出正式版有功能加载问题。
一夜之间,AI终获「永久记忆」!最难考试99%刷爆SOTA,全网直呼疯狂
新智元报道,Supermemory团队推出超级记忆系统ASMR,在AI记忆界最难考试LongMemEval中刷到99%准确率。它抛弃传统模式,采用多Agent并行推理,4月初将开源代码。此外,其背后的Supermemory引擎功能强大,能让AI真正拥有记忆。
刚刚,OpenAI Astra核心架构爆出:大模型第三条Scaling法则诞生
The Information记者爆料OpenAI即将推出的Astra模型采用“recurrent depth”新推理方法,该技术能降本提效,但引发AI安全与可观测性担忧。清华与字节论文解决了循环模型“算力不公平”问题,并给出Scaling Law。
OpenAI彻底重构Codex!长出独立鼠标,自己排班狂卷打工人
OpenAI重磅更新Codex,它能在后台开模拟器、修Bug,不影响前台工作。有独立光标,支持在渲染网页上操作改代码,还上线90多款插件,新增‘心跳’机制,能自己排班,补齐日常刚需功能。
50个Agent分工干活,Kimi K2.5的Agent“军团”把我看呆了。。。
Kimi K2.5今日下午发布并开源,具备多模态能力。它能根据视频、链接等复刻网站,有Visual Edit功能且自动部署上线。还有Agent Swarm场景,多Agent协作解决复杂问题,应用体验佳。