「语言探索」共找到 1757 篇相关文章
工具增强的多模态LLM综述
多模态大语言模型(如GPT - 4V)虽有强大图文理解能力,但受数据稀缺、复杂任务表现不佳和评估标准不统一限制。论文提出为MLLM集成外部工具,构建全景图,覆盖多维度,还指出挑战与对策。
EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法
vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。
苹果憋一年终超同参数 Qwen 2.5?三行代码即可接入 Apple Intelligence,自曝如何做推理
今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化可在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备端模型表现优。
无需训练的LLM对齐方法综述
大型语言模型应用引发担忧,传统微调方法有短板,免训练对齐(TF Alignment)应运而生。本文是首篇系统综述TF对齐技术的论文,提出三阶段分类框架,实验显示TF方法优势明显,还指明未来研究方向。
LeCun亲自官宣!Meta世界模型V-JEPA 2登场!仅用62小时机器人数据,就能实现零样本控制!
Meta发布V-JEPA 2世界模型及三个新基准测试,Meta首席AI科学家Yann LeCun介绍其不同。V-JEPA 2基于视频训练,用62小时机器人数据就能实现零样本控制,还将探索分层式模型和多模态建模。
从检测到通用感知:构建空间智能的基础
本文整理自张磊在AICon 2025北京的分享,分析语言与视觉原生模型架构区别,介绍基于Transformer的物体检测算法及开集检测技术进展,如Grounding DINO和DINO - X,还探讨其在多领域的应用和潜力。
AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源
快手全新多模态大语言模型Kwai Keye-VL上线且开源,能深度融合多模态信息,在视频理解、复杂视觉感知和逻辑推理上表现优异。介绍了其技术架构、预训练和后训练策略及训练架构优化等内容。
从「知题」到「知人」:UserRL让智能体学会「以人为本」
大语言模型距成真正用户伙伴缺‘知人’能力。来自UIUC与Salesforce团队提出UserBench和UserRL方案。前者将‘用户特性’制度化,构建评测环境;后者搭建统一强化学习框架,探索奖励建模,二者让‘以用户为中心’落地。
Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键
Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。
第一章:AI 技术前沿全景
文章聚焦AI Agent技术前沿,阐述大语言模型三次能力跃迁,从涌现能力到对齐指令遵循,再到推理与行动。还提及Scaling Law变化,推理时计算扩展更划算,介绍代表性推理方案及多模态融合,指出Agent打破传统对话AI局限。