「跨镜头记忆机制」共找到 1358 篇相关文章
视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别多视图依赖
清华大学联合腾讯提出Scene Splatter,基于视频扩散模型,从动量视角引导其生成满足三维一致性的视频片段,提升三维场景生成效果,解决了传统方法在单张图片重建三维场景的难题。
用大模型检测工业品异常,复旦腾讯优图新算法入选CVPR 2025
AI模型用于工业异常检测获新SOTA,相关论文中稿CVPR 2025。复旦大学、腾讯优图实验室等机构研究人员设计基于扩散模型的少样本异常图像生成新模型DualAnoDiff,实验显示其性能更优。
AI编程到底有没有护城河?RL+Agent重塑代码世界!
作者作为cursor重度用户和算法出身玩家,分享AI编程赛道技术内幕。探讨AI编程视角下RL的难题,介绍AI编程体验进化要素,还聊了cursor 1.0更新,最后指出AI编程工具发展趋势。
快速理解热门LLM大语言模型
本文用通俗易懂方式帮读者理解LLM、Transformer、Prompt等基本概念,介绍大模型API使用,如温度参数、角色设定等,还提及Function Calling、Agent、MCP等内容,并对AI未来发展作出假想。
AI编程新王Claude 4,深夜震撼登基!连续编码7小时,开发者惊掉下巴
Anthropic发布全球最强编程模型Claude 4,含Opus 4和Sonnet 4。Opus 4是顶尖编码模型,Sonnet 4是Sonnet 3.7的重大升级。还发布系列产品,Claude 4定价与此前一致,部分用户可体验。
openJiuwen协同昇腾打造智能体「算力亲和」技术,首token时延砍半,推理存储占用下降25%
传统推理引擎难以理解 Agent 任务状态,导致推理时延久、显存占用高等问题。openJiuwen 协同昇腾打造智能体「算力亲和」技术,建立语义协同机制,优化 KV Cache 管理,提升 Agent 系统运行效率。
从 AI 取数到智能分析:企业级数据 Agent 的多阶段演进与工程化落地
文章整理自 Shopee 技术专家王新波在 QCon 全球软件开发大会 2026 北京站的分享。复盘团队打造企业级 Data Agent 实践,揭示技术演进路径,分享将取数工具雕琢为智能分析工具的方法。
首个长程Doc2Repo训练集!代码Agent不止修bug,开始造仓库
中国人民大学高瓴人工智能学院发布DeNovoSWE数据集,专注长程软件工程任务。它通过特定机制构造高质量数据,为代码智能体长程能力训练提供支持,实验显示能显著提升模型仓库生成能力。
给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策
上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。
17岁高中生做出AI神器:看一下视网膜,就能识别自闭症和多动症
美国17岁高中生Edward Kang开发AI工具RetinaMind,通过视网膜图像识别自闭症和多动症,准确率达89%,还能分析疾病基因机制。该成果助他获2026年Regeneron科学天才奖二等奖及奖金。