「多模态生成」共找到 2921 篇相关文章
使用 Node.js + OpenAI + MongoDB 实现文本向量知识库搜索
本文介绍用 Node.js、OpenAI Embedding API 和 MongoDB 实现文本向量知识库搜索系统,涵盖环境准备、文本切分与向量存储、本地语义检索等,还提及用 MongoDB Atlas 提升性能及后续延伸方向。
「边思考、边搜索、边写作」WebThinker开启AI搜索&研究新纪元!
大型推理模型有推理能力,但静态知识限制其在复杂任务表现。WebThinker 让 LRM 推理中自主搜索、导航及写报告,集成探索器,有自主策略和训练工具,实验显示性能强,还指明未来探索方向。
新版GPT Image 2.5已经能伪造GPT-6发布会了
GPT-6还未发布,新版生图模型GPT Image 2.5就能伪造其发布会。它升级幅度大,测试显示能伪造奥特曼全员信等,在LMArena测试有生成快、图像逼真等特点,生图或成GPT-6主打功能。
Meta开源Muse Glimmer,30B Agent小钢炮跑进你的电脑
Meta发布并以宽松协议开源Agent模型Muse Glimmer。它30B参数,能跑在Mac或PC上,多项Agent基准领先。可完成端到端任务、调用工具及多步推理,接受文本与图像交错输入,用途广泛。
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测
近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。
AI科研全周期拆解:从选题到宣发,哪里能放手,哪里得盯着
Awesome AI Auto-Research Team 综述梳理 AI 科研全周期能力与局限,按四阶段八环节拆解,介绍五种方法范式,指出各阶段应用情况、瓶颈及规律,强调人本治理的 AI 辅助科研才是可信路径。
“这个怎么组装?”一句无害的问题,如何让AI产生危险输出
Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。
数据合成有没有未来?事实结论来了
有人认为用大模型合成数据可快速生产,无需人工标注。但作者观察发现人工标注不仅必要且要求更高。以Scale AI、Surge AI为例说明标注价值,还展示‘智能知识’团队对两数据集审查结果,证明高质量数据需专家和管理流程。
谷歌Gemini 3.1新模型深夜掀桌, 每秒狂飙363 token! 1/4价格暴击Claude
谷歌深夜推出Gemini 3.1 Flash-Lite,输出速度363 token/s,价格仅0.25美元/百万Token,跑分碾压GPT-5 mini和Claude 4.5 Haiku。开发者可通过Google AI Studio体验,企业用户可通过Vertex AI接入。
字节开源版Seedance发布,超越Sora 2!
字节Alive团队发布开源版Seedance 2.0,在人类评估中超越Sora 2等。它通过统一架构、时空对齐技术和非对称训练策略,解决声画不同步和画质音质难两全问题,还建立数据流水线和测试基准。