「多模态检索」共找到 1147 篇相关文章
NICE59期 | Agent进入下一篇章!Alita:不靠人工预设,自己造MCP自我进化的AI
这篇论文提出让 Agent 主动创造解决 MCP 的工具实现自我进化,工具可网上检索或自主编写。Alita 做法更通用实效,还提出‘Agent 蒸馏’思想,其生成的 MCP 已用于‘manus’。
为什么Cline不对你的代码库进行索引(以及为什么这是好事)
用户常问Cline如何处理大型代码库,是否用RAG索引全部代码。Cline特意选择不对代码库进行索引,因为传统RAG方法用于代码库有逻辑切割、索引过时、安全风险等问题。Cline像开发者一样处理代码,有独特优势。
欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车
Mistral AI发布多模态模型Mistral Medium 3,官方称其性能接近Claude Sonnet 3.7且成本低,有诸多亮点。但网友实测结果不一,部分大佬认为性能不如官方宣传,建议别下载。
刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路
Claude Fable 5.1虽可兼容旧版提示词,但行为习惯有变化。官方整理提示词与工程落地指南,涵盖思考程度、工具调用进度汇报、独立工具批量调用等多方面使用技巧和避坑细节。
阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天
阿里发布原生流媒体端到端模型Wan - Streamer v0.1,能实时聆听、观看、思考、说话和响应视频。它在单个Transformer内完成感知等操作,延迟低,具备端到端多模态统一、低延迟等特点。
ACL 2026|证据摊开看,场景图画清:让流式视频大模型拿捏「何时开口」
随着多模态和大语言模型发展,人类与 AI 交互走向共生。现有视频大模型难把握响应时机,西北工业大学等团队在 ACL 2026 提出 Response - G1 框架,实验显示其提升了模型性能。
从「说错话」到「干错事」:复旦、CityUHK、SMU、UIUC等13家机构联合发布「具身智能安全」综述
具身智能正从实验室走向现实世界,却带来‘干错事’的现实风险。13家机构38位学者联合发布70+页综述,提出‘能力—风险’二象性,梳理各能力层攻击面与风险,还指出研究空白,维护开放资源生态。
ChatGPT那一套要过时了?翁荔实测创业首个模型,回合制AI被“原生实时交互”秒了
Thinking Machines推出交互模型TML - Interaction - Small,可实时接收多模态输入并响应,性能超现有实时系统。该模型未开放,计划先有限预览再广泛发布,若开放将为企业带来巨大价值。
重磅!iPhone 端侧可部署 Gemma 4 了!完全零token消耗!
PhoneClaw 是运行在 iPhone 的本地 AI Agent,可离线运行 Google Gemma 4。它支持多模态,有隐私保障和灵活模型管理。文中介绍使用方法、自定义 Skill 方式、常见问题,还提及后续扩展计划。
Context Mode:为你的AI开发工具节省98%的上下文token
开发者分享开源项目Context Mode,它在Claude Code和工具输出间加中间层,采用沙箱隔离和精准检索策略,能节省98%上下文空间,与Cloudflare Code Mode互补,可提升AI从业者工作效率。