「视觉逻辑排版」共找到 1045 篇相关文章
3D-R1:让AI理解3D世界的下一步
文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。
不止AlphaFold,「药界ChatGPT」横空出世!华人女投资人深度揭秘
AI初创Chai Discovery宣布分子设计模型Chai-2重构药物设计逻辑,将抗体设计成功率从0.1%提升到16%,实现零样本设计。其联创认为这是范式革命,未来药神或成提示词工程师。
【展讯】不止观看:澳门当代摄影展|三影堂北京
本次《不止观看:澳门当代摄影展》汇集孙彦等13位澳门艺术家的创作,他们突破传统影像边界,将澳门多元文化转化为视觉文本。展览作品探讨摄影与城市、文化、技术等关系,呈现从传统到AI的多元脉络。
Token洪流的转向:当AI Agent成为Token消耗的主宰,什么样的推理服务基础设施才是刚需
Token消耗量转移,AI Agent成Token消耗主宰,大模型推理服务底层逻辑重塑。文章介绍AI Agent时代范式转变、对推理基础设施的需求,还阐述了为其打造的AI Serving Stack架构及优势,它获2025年度相关卓越奖。
ImageNet作者苏昊被曝任教复旦
ImageNet作者之一苏昊被曝要去复旦任教。他是具身智能领域论文被引次数最高的华人学者,主导多个奠基级项目。他研究从语言到2D、3D视觉,再到机器人,还创办具身智能公司Hillbot。
腾讯混元发布并开源图像模型 2.1,支持原生 2K 生图
9月9日深夜,腾讯发布并开源混元生图模型“混元图像2.1”,支持原生2K高清生图,综合能力领先。它在多方面升级,有诸多亮点,评估显示效果优,还同步开源文本改写模型,能满足多样视觉需求。
从单领域到多能力协同:数据混合如何重塑AI的强化学习
上海AI Lab的OpenDataLab团队通过大规模实验剖析可验证强化学习(RLVR)在多领域推理中的机制,发现逻辑与数学数据相互支持、代码推理有跨领域混合效应等,为构建AI推理模型提供关键发现。
ChatGPT Images 2.0震撼发布!碾压谷歌Nano Banana,设计真要完了
北京时间凌晨3点,OpenAI发布ChatGPT Images 2.0,是先进模型,能处理复杂视觉任务。它精度控制力高、多语言能力强,风格表达成熟,支持多种宽高比,有现实世界理解能力等,已向相关用户开放,但也有局限性。
老黄亲自站台,英伟达编程神器!Cursor 2.0自研模型狂飙4倍
Cursor 2.0版本重大升级,发布自研编码模型Composer,速度是同等模型4倍。还重构IDE交互逻辑,支持多智能体模式,引入语音模式等。早期测试和开发者反馈其速度快,但智能程度与部分模型有差距。
为什么Cline不对你的代码库进行索引(以及为什么这是好事)
用户常问Cline如何处理大型代码库,是否用RAG索引全部代码。Cline特意选择不对代码库进行索引,因为传统RAG方法用于代码库有逻辑切割、索引过时、安全风险等问题。Cline像开发者一样处理代码,有独特优势。