无预训练模型」共找到 8413 篇相关文章

开源动态8

最小模型仅 25MB,老设备 GPU 也能流畅跑!

开源项目`KittenTTS`是文本转语音模型系列,核心特点是“小身材,大能量”。最小模型约1500万参数,体积25MB以内,需GPU,靠CPU就能实现高质量语音合成,适合多种设备和场景。

开源先锋
开源动态8

美团开源新模型,多项能力实测第一

美团发布5600亿参数的LongCat - Flash模型,有创新动态计算机制和高效训练推理架构。它在多项测评中领先,尤其在代理工具使用测试表现出色,还以宽松许可开源,降低使用门槛。

AIGC开放社区
推荐文章7

深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来

本文深入解读“世界模型”,虽明确定义,但从目的出发分为表征和生成两类。前者含生物大脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。

AI科技评论
产品应用7

Unsloth让大模型跑在手机上!

Unsloth放出教程,可将其微调模型部署到Pixel 8和iPhone 15 Pro。用ExecuTorch技术优化,Qwen2 - 0.5B在旗舰机上表现流畅。教程介绍量化感知训练控制精度损失,还给出iOS和Android部署步骤及注意事项。

AI工程化
开源动态7

OpenClaw 之后,Agentic RL有了新训练范式

模型技术推动AI从‘回答问题’迈向‘执行任务’,Agentic AI兴起。中国科大认知智能全国重点实验室提出Claw - R1项目,将前沿Agent Runtime与强化学习训练框架结合,为Agentic AI提供新训练基础设施。

PaperAgent
新闻资讯7

对话地平线前高管牛建伟:万亿参数大模型如何重塑具身智能

具身智能赛道分“VLA派”“智驾降维派”和“大模型派”。地平线前高管牛建伟认为VLA是弯路,主张用分层架构,以万亿参数“空间智能大模型”做大脑,VA小模型执行操作,目标是做物理世界的OpenClaw。

AI科技评论
算法论文8

为什么大模型会产生幻觉?OpenAI最新研究终于搞清楚了

OpenAI发布研究论文剖析LLM幻觉根源,指出当前主流训练与评估体系是核心驱动因素之一。现行评估奖励猜测行为,幻觉起源于预训练的‘下一词预测’,论文还澄清五大误区,建议改革评估体系。

AI寒武纪
开源动态8

里程碑时刻!首个100B扩散语言模型来了,技术报告揭秘背后细节

蚂蚁集团与高校联合团队推出 LLaDA2.0 系列扩散语言模型,其中 LLaDA2.0 - flash 参数量达 100B。技术报告披露细节,其解决了 dLLM 做大做强难题,性能比肩 AR 模型,为扩散模型工业化带来转机。

机器之心
算法论文7

一篇多模态大模型推理技术最新综述

华东师大&字节跳动系统回顾基于强化学习的MLLMs推理进展,涵盖关键算法设计、奖励机制创新及实际应用,探讨了RL在LLMs/MLLMs中的关键设计与优化策略,还涉及多模态大模型推理多方面内容。

PaperAgent
开源动态8

上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体

上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。

机器之心