「多模态记忆系统」共找到 2887 篇相关文章
How To Play AI Beta:拾象 2026 AGI 投资思考开源
这是拾象团队的 AI 投资思考报告,复盘当下竞争时局,拆解 2026 年核心技术与产品趋势。分析了头部模型格局、技术路线、算力阵营等,探讨投资策略,还提及多模态、机器人、Agent 等领域发展。
阿里新王牌千问 APP 曝光:全面硬刚 ChatGPT
11月14日阿里开启「千问 APP」公测,其集成通义千问 Qwen 系列顶尖模型,有多模态能力。它对标 ChatGPT,在中文语境和结构化输出上有优势,实测处理财报、麻将推理等表现佳。
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
自建一个 Agent 很难吗?一语道破,万语难明
作者分享给传统研发平台接入 Agent 开发能力的经验,介绍技术选型、方案落地、系统提示词优化、知识库建设等内容,还提及工具接入、上下文管理等方面,为想自建 Agent 的人提供启发。
烧掉数万亿 Token、数百 Agent 连跑一周:Cursor“从零写浏览器”,结果是拼装人类代码?
Cursor CEO分享用GPT - 5.2让系统运行一周从零构建浏览器的实验,产出大量代码。但实验引发质疑,项目编译难通过,代码还依赖成熟库,像是拼装人类代码,且实验成本高。
苹果传统强项再发力,视觉领域三种模态终于统一
苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。
生成式AI第二阶段:个性化AI助理 + AI Agent将颠覆我们的生活工作方式
生成式AI已迈入第二阶段,核心是能“动手办事”的AI智能体。未来AI以AI助理和AI代理形式存在,两者协同工作将带来工作方式革命,但面临记忆、信任、伦理等挑战。
大模型“记性差一点”反而更聪明!金鱼损失随机剔除token,让AI不再死记硬背
马里兰大学等团队提出金鱼损失法,训练时随机剔除部分token,让模型不逐字记内容,仍学语言规律。实验显示,LLaMA - 2用该方法后记忆内容减少,下游任务性能影响小。
同行评审濒临崩溃!一篇审稿报告450美元?科学家不再愿意「用爱发电」
同行评审面临劳动力短缺困境,申请者互评成热门方案。该系统还存在研究质量下滑、创新想法被埋没等问题。为解决问题,人们尝试付费审稿、提供评审指南等,也有人建议彻底改革或废除。
太强了 Yan!腾讯打造的全能交互视频生成引擎
腾讯提出的面向交互式视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供可行路径,但也面临长时视频视觉一致性不足等问题。