「多模型 Agent」共找到 11003 篇相关文章
让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。
100 刀订阅的 Claude Cowork,被 GitHub 大神 2 天手搓出「开源升级版」!
Anthropic 的 Claude Cowork 功能强大,但昂贵门槛挡住多数人。开源社区的 Accomplish,开发者 2 天就搓出其开源平替版,还是升级版,能本地运行、支持多模型。
AI大牛刘威创立的Video Rebirth,刚刚又完成8000万美元融资
AI视频生成企业Video Rebirth完成8000万美元融资,由AMD Ventures、现代汽车等跨界投资。其由刘威创立,首创Dual Diffusion Transformer架构,新资金用于Bach模型商业化与全球扩张。
一篇95页最新80种Deep Research系统全面综述
浙大研究深度研究系统领域,分析自2023年以来80多个相关实现,提出4维度分层分类法,全面分析4种实现架构,还阐述各维度演变进步。
DeepSeek-V4发布!高效百万上下文智能普惠时代来了
DeepSeek-V4发布,是开源社区关键分水岭。它解决超长文本处理效率痛点,架构与优化有多项突破,降低算力消耗和成本,适配国产芯片,性能比肩顶级闭源模型,推动开源社区两大未来趋势。
Deepseek V4 Pro深夜上线,性能追平Fable 5,但价格只有它的2%
2026年8月12日,DeepSeek V4 Pro正式版上线。它是混合专家模型,规模居世界第一梯队。价格比Claude Fable 5便宜超98%,成本优势明显。其架构节省成本,API开放多模式,产品结构清晰。
包含一个 75+ AI 工程项目!所有内容100%开源
此 GitHub 仓库含 93+ 生产级 AI 项目,覆盖大语言模型、RAG、Agent 等主题。有不同难度项目及教程,适合各水平人士,还给出新手入门学习路径,采用 MIT 许可。
谷歌放大招!Gemini「吞下」2.5亿地图数据,路痴AI一夜成精
谷歌推出「Grounding with Google Maps」功能,让Gemini接入Google Maps,可调用2.5亿地点信息。本次更新拓展了AI能力边界,适用于多领域,部分Gemini模型支持,还介绍了使用示例。
刚刚,加入腾讯的姚顺雨发表首篇Paper~
腾讯混元与复旦联合发表论文《CL-bench》,姚顺雨署名并全面细致审阅反馈。CL-BENCH 首次单独考‘现学现卖’,有独特设计原则、四大题型,其评分杜绝‘差不多’,还让 10 个前沿模型‘翻车’。
上交博士最新思考:仅用两个问题讲清强化学习
上交博士 Kun Lei 博客提出用两个问题理解强化学习:数据从哪来、策略更新多频繁。借此梳理算法逻辑,还延伸到机器人基础模型,指出训练节奏与其实践契合。