「模型训练与微调」共找到 8122 篇相关文章
李飞飞最新思考:语言模型救不了机器人
本文是对李飞飞的访谈编译。她指出语言模型在世界理解上有短板,空间智能是关键,还探讨了AI发展历程、世界模型重要性等,介绍其公司产品Marble,强调人人在AI时代都有位置。
阿里、南开大学发布免训练,视频大模型创新压缩方法
视频模型序列化处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。
The Batch: 982 | 法律、新闻和金融领域的定制模型
本文是DeeplearningAI《The Batch》的最新报道,汤森路透推出法律、新闻、金融领域定制大语言模型Thomson,基于Qwen构建,性能优于多款通用大模型,小版本将开源供非商业使用。
开源模型TOP5,被中国厂商包圆了
10月公开数据显示中国开源大模型占据榜单前五,阿里Qwen系列和DeepSeek影响力深远。从LMArena榜单、HuggingFace数据看,国产模型表现佳。还提及Llama 5相关传闻。
35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源
5月15日上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,尺寸小、科学能力强,在多方面有突破。其深化与昇腾算力生态协同,探索‘通专融合’,科学及智能体能力升级,还优化训推效率。
Chain-of-Agents: OPPO推出通用智能体模型新范式,多榜单SOTA,模型代码数据全开源
OPPO个性化AI实验室团队推出智能体推理范式CoA及模型AFM,解决传统多智能体系统通信效率低等问题。AFM在近20项测试中刷新记录,降低推理成本,还介绍了架构、数据构建等,也指出待探索方向。
Efficiency Law, 物理精确世界模型,及世界模型引擎驱动的具身智能学习新范式
2025年秋具身智能赛道火热,特斯拉、英伟达动作不断,数据问题成落地症结。跨维智能贾奎、港中大(深圳)刘桂良探讨突破具身智能学习枷锁的方法,提出Efficiency Law和GS - World世界模型引擎及新学习范式。
上新:Cache-DIT 支持LTX-2模型
作者和DefTruth在Cache-DIT上支持了LTX-2模型,记录适配关键点,包括模型侧、框架侧适配。介绍LTX-2特点,如支持T2V/I2V、输出带音频,还说明Cache-DIT加载区分T2V/I2V方法及cache侧修改内容,最后给出使用示例。
7,700+ star 微软 SkillOpt 可以训练的Skill
微软研究院开源了SkillOpt(7700+ star),把Skill文档当成‘可训练的权重’来优化。它有独特的6阶段流水线、核心验证门控、Protected Regions机制,还有SkillOpt - Sleep预览功能,让Skill文档可系统化训练。
亚马逊发布新AI大模型,部署机器人突破100万
全球电商、云计算巨头亚马逊宣布推出新AI基础大模型Deep Fleet,部署机器人超100万。该模型可提升机器人车队出行效率,还能协调机器人移动,带来交付快、成本低等好处。