「视觉语言理解」共找到 2167 篇相关文章
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
当前大语言模型在长周期任务中,长时持久记忆管理陷入“精度不够”和“成本太高”的两难困境。中国人民大学团队提出MemSifter框架,将记忆检索工作外包给轻量级代理模型,在8个权威测试中超越现有方案,且已开源。
推荐系统进入「双动力」时代!首篇LLM-RL协同推荐综述深度解析
强化学习是推荐系统主流建模范式,但传统 RL 推荐系统有诸多瓶颈。大语言模型崛起带来新机遇,LLM 与 RL 结合开启新范式。研究团队发布首篇相关综述,提出五大协同范式,总结评估体系,分析挑战与方向。
震撼!0人类,16个Claude全自主开发,2万美元十万行代码成功运行Linux
Anthropic研究员用Claude Opus 4.6智能体团队自主编写超十万行代码的C语言编译器,能运行《毁灭战士》、编译Linux内核。团队用拉夫循环等机制让Claude自主开发,虽有局限但全自动软件开发时代已提前降临。
当LeCun还在「画饼」,中国AI大牛领先李飞飞一步把世界模型开源了
具身智能突破「遥操作」数据桎梏,商汤联合创始人王晓刚领衔的大晓机器人发布全球首个开源商业落地世界模型「开悟3.0」。它是多模态理解 - 生成 - 预测一体化,有强物理感知力,还解决了空间感和时间记忆问题。
多模态思维链如何重塑 AI 与短视频的未来
传统多模态模型在动态视频理解与复杂推理场景面临挑战,快手开源的 Keye-VL 模型在多模态思维链技术实现突破。文章解析其核心技术,分享在快手短视频社区的落地应用,还探讨了未来“Think with Video”的技术方向。
对谈 Skyris 张宇诺:AI 陪伴机器人会飞,理所应当 | 00 后创业者系列
这是对 00 后创业者张宇诺的访谈,他介绍了 Skyris 会飞陪伴机器人的设计灵感、特点及优势,还谈及创业经历、对陪伴的理解,以及产品研发难题、规划等,最后提到 GAIR 2025 大会将邀 00 后 AI 创业者分享。
量化噪声竟是RL秘钥?QeRL:高效强化学习新范式,一场噪声引发的性能革命
近年来,大语言模型在复杂推理任务中面临挑战,强化学习虽更接近人类推理过程,但训练“烧资源”。论文《QeRL》提出量化不仅能压缩模型、节省资源,还能增强模型探索能力,QeRL框架实现训练速度提升、内存占用减半。
18岁天才少年,登上Nature封面!
DeepSeek-R1荣登Nature封面,成史上首个经严格同行评议大模型。18岁天才少年涂津豪以实习生身份参与,其从高中生到Nature作者的经历堪称传奇。他还改造Claude 3.5,开源项目获15k多星,还对AGI发表思考。
将 AI 注入 Java 应用程序
文章围绕将 AI 注入 Java 应用程序展开,以宇宙飞船租赁应用的聊天机器人为例,介绍如何用 LangChain4j 和 Quarkus 等 Java 框架与大语言模型(LLM)交互,还提及流式响应、结构化输出等功能及相关概念。
刚刚!Qwen3深夜升级,碾压Kimi K2和DeepSeek V3
通义千问更新旗舰版Qwen3模型,推出Qwen3 - 235B - A22B - Instruct - 2507 - FP8。新模型通用能力显著提升,在多测评中超Kimi - K2等模型,还增强多语言覆盖等性能,已在魔搭和Hugging Face开源。