大模型架构图」共找到 9813 篇相关文章

产品应用7

安全垂类小模型效果能超过模型?看看以色列Novee的效果

跟踪AI渗透测试等开源应用发现,通用模型成本高、功能受限。以色列Novee融资5150万美元并发布4B小模型,测试效果超Claude 4 Sonnet。其靠两阶段训练和浏览器反馈提升能力,有投资说明有价值。

AI与安全
算法论文8

Nature Machine Intelligence颠覆有机化学研究范式,上海交发表化学合成语言模型

上交AI4S团队依托平台,联合多团队在AI for Chemistry领域获突破。相关研究发表于《Nature Machine Intelligence》,介绍白玉兰化学合成模型Chemma,它加速有机合成全流程,在多任务表现出色,还能解决数据稀疏等问题。

AI科技评论
开源动态8

杨立昆亲自指导开源世界模型,为AI Agent打造超级

今天凌晨,Meta开源世界模型V - JEPA 2,它用超规模数据集训练,能让AI Agent理解物理世界。图灵奖得主杨立昆参与开发并推荐。模型经多方面改进,还拓展用于机器人规划和视频问答,效果良好。

AIGC开放社区
算法论文8

NeurIPS 25 | GRPO进阶版来了,GVPO重构模型后训练范式

模型后训练越发关键,GRPO 有缺陷。作业帮与香港科技学(广州)团队在 NeurIPS 2025 提出 GVPO 方法,解决 GRPO 稳定性难题,理论有最优解保证,实验表现超现有方法。

机器之心
开源动态8

刚刚,杨植麟亲自开源Kimi K2.5!国产模型打架的一天

今天国产模型热闹非凡,Kimi更新至K2.5版本。它是万亿参数的MoE基础模型,开源且在多项评测表现佳,视觉与编码能力强,还引入Agent Swarm功能,实测展示其解决各类复杂任务能力。

机器之心
推荐文章8

AI模型开发核心技术栈:从框架到部署的全景解析

本文为开发者提供2025年AI模型开发核心技术栈图谱,解析四核心支柱技术。基础开发框架含深度学习与AI Agent框架;模型训练与微调有分布式训练、参数高效微调;推理优化含关键技术与主流框架;AI编程辅助工具分主流形态且有发展趋势。

AIGC开放社区
开源动态8

字节跳动&清华学开源多模态时序模型ChatTS,可实现时序数据对话与推理

字节跳动与清华合作开源多模态时序模型ChatTS,可实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来可拓展至更高阶任务。

机器之心
新闻资讯8

啊?微博7800美元训的模型,数学能力超了DeepSeek-R1

近日,微博发布自研开源模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后训练成本仅7800美元。其为AI产业带来新思考,还将推动微博AI应用发展。

量子位
算法论文8

破解MoE模型“规模越,效率越低”困境!中科院自动化所提出新框架

模型参数量飙升却陷入‘规模越,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化。

量子位
开源动态8

20000 GPU·h砸出 106 个SOTA模型架构:AI 科研进入“自我加速”时代

模型架构发现领域迎来突破,ASI - ARCH超级智能体无需人类预设搜索空间,完成科研闭环。经20000 GPU·h、1773次实验,发现106个超越人类SOTA的线性注意力架构,且已开源。

PaperAgent