「文本驱动动作生成」共找到 1298 篇相关文章
最火、最全的Agent记忆综述,NUS、人大、复旦、北大等联合出品
多所顶级学术机构联合发布百页综述《Memory in the Age of AI Agents: A Survey》,为‘Agent Memory’梳理技术路径。提出三角框架,辨析与其他概念差异,还探讨记忆形式、功能、运转机制,展望未来发展方向。
意图是 AI 时代的新入口|AGIX PM Notes
文章围绕AI时代展开,指出互联网时代商业模式核心是“入口”,AI时代应关注“意图”。还提及上周对冲基金资金流动、AI企业动态,如微软推安全方案、Alphabet合资开发机器人等。
三位AI殿堂级人物罕见同框:LeCun、李飞飞、谢赛宁团队用空间超感知让AI像人一样理解三维世界
谢赛宁团队联合杨立昆、李飞飞发布Cambrian - S研究,提出空间超感知概念,指出现有AI视频理解或被高估,推出VSI - SUPER基准测试,虽Cambrian - S模型有提升但仍有局限,预测性感知或成新范式。
“AI不是工具,是工人!” 英伟达GTC 2025,黄仁勋如是说
英伟达GTC 2025大会上,黄仁勋提出“AI不是工具,是会用工具的工人”,重新定义人类与技术关系。阐述AI产业本质、三大扩展定律,公布GPU路线图及新硬件,还将AI部署到多行业,构建全栈生态。
Meta裁员、OpenAI重组:万字复盘谷歌起笔的AI史诗,如何被「群雄」改写剧本?
近期AI公司动作不断,Meta、OpenAI等有重大变动,显示行业从“淘金热”转向“阵地战”。文章复盘AI发展,以谷歌为主线,穿插其他巨头历程,还结合当下现状深度分析发展与战略博弈。
GraphRAG圈新秀:文档级RAKG
随着大模型能力增强,知识图谱成研究热点。传统KGC有实体消歧难、模式僵化等痛点。文章提出RAKG框架,将RAG评估机制引入知识图谱构建,实现文档级自动化构建与评估,多指标表现优异。
浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力
浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。
开源AI教育视频生成神器,3Blue1Brown风教学动画一键搞定!
新加坡国立大学Show Lab团队开源Code2Video,能让代码变高质量教育视频,逻辑是用代码驱动视觉效果。它有智能解析等特性,可解决传统教学视频形式单一等问题,应用场景广泛。
大模型破译甲骨文创下新SOTA!复旦团队推出新框架
复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据集。该框架在公开基准数据集上准确率高,零样本破译能力强,能输出可解释分析文本,助力考古破译。
Meta两员大将回流OpenAI,30天爆赚800万?刚入职闪回巢,小扎钞能力失效
Meta成立两月的“梦之队”MSL痛失三位核心研究员,两位前OpenAI员工入职一月回流,另一位因小扎一句话离职,十年老将也将加入OpenAI。Meta高薪挖人,却因内部重组、研发问题等面临人才流失。