「检索增强生成」共找到 2693 篇相关文章
Nano Banana Pro上线!集成Gemini 3与Veo 3,谷歌不给竞争对手喘息机会
谷歌推出最强文生图模型Nano Banana Pro,又名Gemini 3 Pro Image,整合Gemini 3 Pro多模态理解能力与谷歌搜索知识库。它提升文字渲染等能力,支持多种分辨率和格式,还集成视频生成模型,覆盖多类用户。
MiniMax秀了波AI视频杂技:越看越惊艳,指令遵循太强了
MiniMax发布海螺2.0版本,能处理极端物理情况,原生支持1080P,在指令遵循、生成质量达一流水平,成本效率破纪录。此前还开源MiniMax - M1,两大底层技术创新让其成果惊艳,展现研发实力。
DeepSeek V3.1 突发离谱「极」字Bug的原因找到了~
DeepSeek V3.1被曝恶意漏洞,生成文本时会突然插入“极”字。该漏洞在第三方API平台和官方Playground均有出现,可能因数据集“污染”或模型“偷懒”,严重影响高精度场景。
通用的dLLM开发框架,让BERT掌握扩散式对话
扩散式语言模型(DLM)因缺乏易用框架和训练成本高受限。伯克利与UIUC团队基于dLLM框架,让BERT学会对话,证明‘离散扩散 + 轻量级指令微调’可赋予BERT强生成能力,还开源全流程代码。
「香蕉革命」首揭秘!谷歌疯狂工程师死磕文字渲染,竟意外炼出最强模型
谷歌最新图像模型nano banana横空出世,能融合图片、理解地理等结构,实现多轮创作。它凭借Gemini知识与交错生成技术,重塑AI图像生成边界。谷歌团队揭秘其技术,还谈及未来发展方向。
谷歌 Gemini API 负责人自曝:用竞品Claude Code 1小时复现自己团队一年成果,工程师圈炸了!
谷歌主管工程师 Jaana Dogan 称,用竞品 Claude Code 一小时就生成了接近自己团队一年成果的系统。她公开评价引发争议,也让大家思考‘一年工程 vs 一小时生成’背后被压缩的是什么。
华为Doc-Researcher 布局感知+视觉语义双杀
现有深度研究系统依赖文本网页数据,忽视多模态文档知识。华为Doc - Researcher系统解决多模态文档解析不足、检索策略有限、缺乏深度研究能力等问题,含多模块,能处理复杂多模态任务。
全网实测Gemini Omni!一句话改视频,草图变大片
谷歌在Google I/O大会推出Gemini Omni,它结合推理与生成能力,在多方面有重大飞跃,能生成逼真视频等。它打破命名体系,训练目标不同,有涌现能力,谷歌还为其设置限制。
阿里开源自主搜索AI Agent,搜论文、网站资讯无所不能
今天凌晨,阿里开源创新自主搜索AI Agent——WebAgent,具备端到端自主信息检索与多步推理能力。还介绍了WebDancer框架从数据构建到训练优化各阶段,助其完成复杂信息检索任务。
Sora2还在5秒打转,字节AI生视频已经4分钟“起飞”
字节和UCLA联合提出Self - Forcing++方法,无需更换模型架构或重收集数据集,就能生成分钟级长视频,最长达4分15秒,高质量且开源,在长、短时长生成上性能领先。