「多阶段强化学习」共找到 2106 篇相关文章
75页哈工大多模态推理大模型最新综述:感知、推理、思考与规划
哈工大提出75页多模态推理大模型综述,围绕四阶段发展路线图展开,即感知驱动的模块化推理、以语言为中心的短推理、以语言为中心的长推理、迈向原生多模态推理模型,还给出挑战性基准测试和实验案例见解。
AI编码工具变 “格式化神器”?Claude CLI半年频当“系统杀手”,多位开发者痛斥:心血都没了!
近日Reddit上一则对Claude CLI的控诉帖引发关注。一位开发者用其清理软件包时,整个Mac系统被清空。Claude自查称执行了含“~/”的灾难性命令。类似“删库”事故并非个例,开发者需强化安全意识。
人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架
人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。
字节发了个机器人全能大模型,带队人李航
字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。
ChatGPT正测试神秘功能
ChatGPT正测试名为“Study Together”的新功能,已出现在部分订阅用户工具列表。它或更多提问题让用户回答,似回应谷歌LearnLM,还可能支持多人学习小组模式,有望减少其被滥用可能。
Jina 第4版:多模态向量检索,统一适配,挑战3大任务
Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。
Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了
Cursor新编程模型Composer 2性能超Claude Opus 4.6,价格“脚踝斩”。它靠引入新强化学习方法,让模型学会“做笔记”突破上下文瓶颈,在任务中表现出色,研究员还放出Composer 3消息。
一篇LLM × DATA技术最新系统性综述
上交大、清华等联合发表综述,探讨LLM与数据管理双向关系,分析LLM不同阶段数据管理技术与挑战并给出方案,还讨论了LLM在数据管理任务中的应用进展,为研究和实践提供指导。
Google这个1.5w star 项目牛皮,99%准确率!
Google安全团队开源AI文件类型检测工具Magika,抛弃固定规则匹配,用深度学习精准识别文件真实类型。它内置轻量模型,单CPU毫秒级推理,支持200+格式,准确率约99%,已大规模落地。
X平台如何决定你看到什么?马斯克刚刚开源了X推荐引擎
马斯克开源X平台推荐算法,消除人工干预特征,靠Grok模型理解用户行为。系统由编排、存储和机器学习层协同,经复杂机制精准推送信息,还构建后置过滤体系保证内容质量。