多模态搜索」共找到 1308 篇相关文章

算法论文8

打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力

如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。

机器之心
算法论文8

ACL 2025|为什么你设计的 Prompt 会成功?新理论揭示大模型 Prompt 设计的奥秘与效能

英属哥伦比亚大学等团队剖析Prompt在LLM的CoT推理中调控模型内部信息流,构建量化Prompt搜索空间复杂度理论框架。研究解释提示有效的原因,提供设计高效提示词思路,实验验证理论框架。

机器之心
产品应用8

抢先OpenAI?AIUI全新升级燃爆22亿终端,国内大厂定义智能交互

科大讯飞围绕智能交互场景,对AIUI、机器人超脑等4大平台全面升级。其AIUI以大模型为引擎,有儿童专属交互方案,还推出智能眼镜“三麦阵列”等,各平台在多领域应用成果显著。

新智元
开源动态7

【7.2K Star】Google 基于LangGraph打造全栈Deep Research

谷歌开源Deep Research全栈应用,前端用React(with Vite)和Shadcn UI,后端研究代理用LangGraph,需Redis和Postgres数据库,LLM用Google Gemini,网络搜索用Google Search API,还介绍了Agent执行流程。

CourseAI
开源动态8

GPT-4o连验证码都解不了??SOTA模型成功率仅40%

MetaAgentX团队推出Open CaptchaWorld平台,用于测试Agent解验证码能力。实测SOTA多模态模型成功率低,如GPT - 4o也被难住。该平台特点多样,揭示了当前Agent短板及模型设计新方向。

量子位
新闻资讯7

对话阶跃星辰段楠:“我们可能正触及 Diffusion 能力上限”

阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域基础模型有望出现,还分享视频生成及多模态AI未来核心洞察。

AI科技大本营
开源动态8

文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”

港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。

量子位
6

产品经理从0开始做网站,3个月时间实现每天从谷歌获取流量破千

Andy从产品经理转型为独立开发者,仅用3个月时间就实现了网站日点击破千。他通过不断优化产品、调整SEO策略、增加外链,最终在谷歌搜索中获得了显著的流量增长。

哥飞
开源动态8

当 Agent 尝试接管浏览器,连“我是人类”都证明不了?上海交大开源发布交互评测基准 HLL

随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。

深度学习自然语言处理
算法论文8

迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路

多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。

AI科技评论