「多模态理解与生成」共找到 3421 篇相关文章
使用 Node.js + OpenAI + MongoDB 实现文本向量知识库搜索
本文介绍用 Node.js、OpenAI Embedding API 和 MongoDB 实现文本向量知识库搜索系统,涵盖环境准备、文本切分与向量存储、本地语义检索等,还提及用 MongoDB Atlas 提升性能及后续延伸方向。
「边思考、边搜索、边写作」WebThinker开启AI搜索&研究新纪元!
大型推理模型有推理能力,但静态知识限制其在复杂任务表现。WebThinker 让 LRM 推理中自主搜索、导航及写报告,集成探索器,有自主策略和训练工具,实验显示性能强,还指明未来探索方向。
AI大佬教你如何中顶会:写论文也要关注「叙事」
NeurIPS投稿截止不到一月,Google DeepMind的Neel Nanda发布机器学习论文撰写指南,旨在解决论文表达晦涩问题。指南涵盖理想论文精髓、写作关键要素、结构解析、流程建议及常见问题应对策略。
新版GPT Image 2.5已经能伪造GPT-6发布会了
GPT-6还未发布,新版生图模型GPT Image 2.5就能伪造其发布会。它升级幅度大,测试显示能伪造奥特曼全员信等,在LMArena测试有生成快、图像逼真等特点,生图或成GPT-6主打功能。
Meta开源Muse Glimmer,30B Agent小钢炮跑进你的电脑
Meta发布并以宽松协议开源Agent模型Muse Glimmer。它30B参数,能跑在Mac或PC上,多项Agent基准领先。可完成端到端任务、调用工具及多步推理,接受文本与图像交错输入,用途广泛。
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测
近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。
人大系团队、天使轮数千万元融资,境瞳科技给人类社会建一个「世界模型」
境瞳科技获数千万元天使轮融资,要给人类社会建「世界模型」。其社会模拟器已有超 1350 万个 AI Agent,是全球同类系统中规模最大、置信度最高的。社会智能赛道在硅谷已吸引大量投资,国内境瞳科技是该领域唯一产学研团队。
AI科研全周期拆解:从选题到宣发,哪里能放手,哪里得盯着
Awesome AI Auto-Research Team 综述梳理 AI 科研全周期能力与局限,按四阶段八环节拆解,介绍五种方法范式,指出各阶段应用情况、瓶颈及规律,强调人本治理的 AI 辅助科研才是可信路径。
“这个怎么组装?”一句无害的问题,如何让AI产生危险输出
Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。
NanoCoder:我把50万行的claude code核心机制浓缩成1000行,不可能学不会了吧!
Claude Code 源码泄露后,kimi Agent 团队何宇峰大佬的 NanoCoder 项目,用 950 行 Python 代码重写其核心机制。它实现 7 种关键设计模式,可助理解顶级 AI 编程 Agent 核心设计,还能按需修改。