「多模态记忆系统」共找到 2884 篇相关文章
产业级 Agent 如何破局?百度吴健民:通用模型难“通吃”,垂直场景才是出路
InfoQ 采访百度吴健民探讨产业级 Agent 破局点。他指出 Agentic 模型训练卡点在真实环境复刻;通用模型难“通吃”,垂直场景定制模型是关键;多模态未实现统一建模,分开优化效果更好。
哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型
动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。
14K Star!统御万模的 AI 聚合网关,一个 API 管理所有大模型!
文章分享了AI聚合网关神器New API,它基于Go和React开发,是中转分发系统,像超级转换插头。集成30+模型服务,有多种特性,支持6种部署方式,能收敛混乱的模型调用。
炸裂!谷歌I/O大会王者归来:Gemini“世界模型” 初现,搜索“换脑”,一句话制作原声电影
谷歌I/O 2025大会发布大量技术,虽Gemini 2.5 Ultra未到,但Pro有革新。还推出新模型、代理工具,多模态能力提升,搜索重塑,加入AI眼镜开发,倾尽全力发展AI生态。
VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块
视觉问答模型准确率提升,但高分可能源于记忆。浙江大学等团队提出 ReKey,保留真实场景,只更新决定答案的视觉线索,使评测面向未见过内容,且多数环节可自动完成。
刚刚,Claude最新功能泄露!主动助手Orbit接管一切工作
2026年5月4日,testingcatalog挖出Claude隐藏功能Orbit,大概率会在5月6日Code with Claude大会发布。Orbit是主动式简报+洞察系统,跨Claude和Claude Code平台,能自动生成多工具简报,改变产品形态。
OpenClaw登顶GitHub,满天飞的智能体Skills要怎样设计?
OpenClaw 4 个月获 250K+ Star 登顶 GitHub。智能体 Skills 给大模型装上程序化记忆,研究者解构其概念,阐述设计模式、获取调度逻辑,也指出安全威胁,呼吁建立客观评价体系。
FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性
FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。
Andrej Karpathy:一场里氏 9 级的大地震正在重塑整个编程行业
文章围绕AI在编程领域的应用展开,作者与大师交流AI Coding方式,后提及Andrej Karpathy观点,指出编程行业正被重构,程序员需掌握新抽象层,应对不稳定智能系统。
AI 的本质不是算力,而是「上下文革命」
上交大刘鹏飞团队提出人工智能本质是“上下文革命”,在论文中把“上下文”提升为智能系统核心结构,提出“上下文工程”学科框架,通过实验揭示智能发展规律,为AI发展指明新方向。