「VLM多模态理解能力」共找到 1578 篇相关文章
AI 创业,需要重读 Paul Graham 的「创业 13 条」
2009年YC创始人Paul Graham发表《Startups in 13 Sentences》,虽时间久远但核心观点不过时。创业者Chris Saad、Yaniv Bernstein结合经验和当下环境,剖析这13条创业原则,涵盖选联合创始人、快速发布产品等内容。
一篇200+文献的视觉强化学习技术最新综述
NUS、浙江大学和香港中文大学对强化学习与视觉智能交叉领域进行系统梳理,归纳200余篇工作为四大主题支柱,剖析算法等进展,提炼关键趋势,还介绍LLM的RL方法、视觉RL阵地等。
用户集体大逃亡!Cursor“自杀式政策”致口碑崩塌:“补贴”换来的王座,正被反噬撕碎
很多开发者吐槽和弃用 Cursor,其付费后砍功能、技术变差、营销成“障眼法”,引发信任危机。部分用户转向 Claude Code,AI 编程工具竞争焦点升级,未来有向智能体演进等趋势。
ACL首届博士论文奖公布,华人学者李曼玲获荣誉提名
自然语言处理顶会 ACL 公布首届计算语言学博士论文奖,获奖者是华盛顿大学的 Sewon Min,其论文聚焦大型语言模型数据使用。此外,还有三篇论文获提名,包括李曼玲等学者的成果。
深度解读《AI 智能体的上下文工程》:构建高效 Agent 的七个宝贵教训
作者解读 Manus 团队文章,结合自身理解总结出构建高效 Agent 的 7 个关键点,如依赖上下文工程、提升 Prompt 缓存命中率等,还给出总结与核心启示,对 Agent 开发有借鉴意义。
垂直赛道 Agent 闷声发财指南:如何实现一年超千万营收?
本文围绕垂直赛道的2B Agent展开,分享了语核科技创始人的产品理念与经验,探讨了如何找到有价值的场景、构建高价值闭环。还介绍了客户的应用情况、对Agent的看法及选型考量,强调其商业价值与落地挑战。
IEEE TPAMI 2025 | 北京大学提出LSTKC++,长短期知识解耦与巩固驱动的终身行人重识别
北京大学周嘉欢团队在IEEE TPAMI发布LSTKC++研究成果。该框架引入长短期知识解耦等机制,保障模型学习新知识和记忆历史知识。代码已开源,研究在性能和效率上优势明显,有广泛应用价值和拓展空间。
798现场|算法下的生活新常态
科技发展重塑社会关系,艺术为理解变化提供视角。798艺术区有两个展览,郭城的“虫”探讨技术理性双重性,蒲英玮的“红色计算机”探讨AI权力结构,展现科技与文明发展寓言。
DeepMind首个猜想库开源,获陶哲轩力挺!
谷歌DeepMind开源首个形式化数学猜想库,获陶哲轩力挺。该库用形式化语言重述数学猜想,为AI提供“标准答案模板”,还采取措施确保准确性,诚邀各方参与贡献。
Yann LeCun放出憋了20年的大招:Meta开源V-JEPA 2世界模型
Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。