大模型技术」共找到 10342 篇相关文章

算法论文7

一篇多模态模型推理技术最新综述

华东师&字节跳动系统回顾基于强化学习的MLLMs推理进展,涵盖关键算法设计、奖励机制创新及实际应用,探讨了RL在LLMs/MLLMs中的关键设计与优化策略,还涉及多模态模型推理多方面内容。

PaperAgent
开源动态8

社区供稿 | Hugging Face x 北京中关村学院等机构联合发布生成式基因组模型Carbon:一场关于“生命语言”的范式革命

北京中关村学院等联合发布生成式基因组模型Carbon并开源。Carbon家族有三个版本,旗舰模型Carbon - 3B在多任务匹敌70亿参数的Evo2 - 7B,运行速度快275倍。它在数据、分词、训练上有创新,还实现技术普惠,有多种应用场景。

Hugging Face
开源动态8

企业级OpenClaw最强拍档来了!万亿参数的国产多模态模型,刚刚开源发布

YuanLab.ai团队开源源Yuan3.0 Ultra多模态基础模型,是万亿级开源多模态模型之一。它优化训练效率,在多任务表现突出,为企业Agent AI提供支撑,还提出新算法和训练策略,全面开源推动落地。

量子位
推荐文章8

对话RoboScience邵林:VLOA模型如何突破具身智能泛化瓶颈

本文对话RoboScience联合创始人邵林,探讨VLOA模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人中心、做有温度技术,重视模型落地。

甲子光年
推荐文章7

模型微调知识与实践分享

文章详细介绍型语言模型(LLM)微调知识与实践,包括模型结构、参数量等知识,以及Prompt工程、数据构造、LoRA微调等技术点。还给出微调实践流程,介绍相关平台和框架,如星云、TuningFactory等。

阿里云开发者
新闻资讯8

从MiniMax到DeepSeek:为何头部模型都在押注「交错思维」?

昨日推特博主公布国内几开源模型在 mini - SWE - agent 测试成绩,MiniMax 新一代模型 M2 表现最佳。其采用的「交错思维」技术成亮点,解决了状态漂移问题,正成高性能 Agent 模型标配。M2 既强又省,还给出使用最佳实践。

机器之心
产品应用8

华为曝光两黑科技!打破推理延迟魔咒,模型从此「秒回」

华为通过FusionSpec和OptiQuant两技术创新,对MoE模型进行推理优化。FusionSpec依托昇腾特点,将投机推理框架耗时降至1ms;OptiQuant支持灵活量化,为模型推理提供高性价比。

新智元
推荐文章8

给非技术人的模型介绍:从零训练ChatGPT的全流程、天价成本及企业务实替代方案

文章介绍从零训练ChatGPT级别模型的全流程、高昂成本,指出这对多数企业不现实。建议企业战略从构建转向应用,通过租用API或微调开源模型利用模型,将专有数据视为核心资产。

AI Reading Hub
新闻资讯8

阿里刚投的AI明星,3D模型那种

通用人工智能公司VAST宣布完成5000万美元A轮融资,由阿里、恒旭资本联合领投。其自研3D基础模型领先,发布全新AI 3D模型家族。2025年重点研发世界模型,2026年将加速建设UGC互动内容平台。

量子位
新闻资讯8

斯坦福教授直播训练535B模型模型训练背后的「黑箱」正在被打开?

斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。

机器之心