「视觉 - 语言数据」共找到 3816 篇相关文章
地球级AI智能体爆诞!谷歌地球开外挂,一夜为20亿人洪水预警
谷歌结合世界建模经验与Gemini推理能力,升级Earth AI。它是地理空间AI模型和数据集,可自动连接不同地球AI模型。谷歌还推出新成果,如新一代影像与人口基础模型、空间推理智能体,可用于灾害预警等。
量化噪声竟是RL秘钥?QeRL:高效强化学习新范式,一场噪声引发的性能革命
近年来,大语言模型在复杂推理任务中面临挑战,强化学习虽更接近人类推理过程,但训练“烧资源”。论文《QeRL》提出量化不仅能压缩模型、节省资源,还能增强模型探索能力,QeRL框架实现训练速度提升、内存占用减半。
刚刚,美团推出 136 亿参数视频生成模型
美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频及视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。
Mini-Omni-Reasoner:实时推理,定义下一代端到端对话模型
现有端到端对话模型推理能力未解锁,因深度思考带来延迟。为此提出 Mini - Omni - Reasoner,采用边思考边表达范式,突破‘要么快,要么准’困境,还设计了数据合成管线和五阶段训练方法,实验证明其性能提升明显。
将 AI 注入 Java 应用程序
文章围绕将 AI 注入 Java 应用程序展开,以宇宙飞船租赁应用的聊天机器人为例,介绍如何用 LangChain4j 和 Quarkus 等 Java 框架与大语言模型(LLM)交互,还提及流式响应、结构化输出等功能及相关概念。
刚刚!Qwen3深夜升级,碾压Kimi K2和DeepSeek V3
通义千问更新旗舰版Qwen3模型,推出Qwen3 - 235B - A22B - Instruct - 2507 - FP8。新模型通用能力显著提升,在多测评中超Kimi - K2等模型,还增强多语言覆盖等性能,已在魔搭和Hugging Face开源。
工行x上交大发布多智能体研究成果,通过群体智能刷新翻译新高度!
2025年多智能体系统成大模型研发新高地。工行大数据和人工智能实验室与上海交大人工智能学院推出多智能体翻译系统TACTIC,以认知翻译学为指导,在相同模型配置下提升翻译效果,在小模型下提升更明显。
500美元刷新SOTA!训练成本砍到1/200,华人团队重构视频生成范式
香港城市大学等团队发布图像 - 视频生成模型Pusa V1.0,在基础大模型上引入VTA机制,用3860对视频 - 文字数据、约500美元微调,在I2V超越Wan - I2V - 14B实现SOTA,还解锁零样本任务能力。
重塑记忆架构:LLM正在安装「操作系统」
现代大型语言模型(LLM)存在「记忆缺陷」,难以维持长期记忆。近期关于大模型记忆的研究增多,如 MemOS 等。文中介绍了长上下文处理能力与记忆的关系、记忆类型,以及实现 LLM 记忆的多种方法和相关研究成果。
AI 陪伴赛道,会诞生下一个「泡泡玛特」吗? | GAIR Live
AI科技评论组织“AI陪伴”线上圆桌,多位从业者探讨AI陪伴是否伪命题、不同人群接受度、产品核心价值等,还讨论IP对AI硬件的重要性、硬件与软件优势、是否出海等问题。