上科大」共找到 6455 篇相关文章

开源动态8

Transformer创新架构SALA:下文更长,推理更快

面壁智能发布行业首个规模训练的稀疏 - 线性注意力混合架构 SALA 及文本模型 MiniCPM - SALA。该架构降低推理开销与显存占用,MiniCPM - SALA 在长文本处理及推理表现出色,还发起奖赛探索性能极限。

PaperAgent
开源动态8

智能必须基于世界模型?我们和蚂蚁灵波团队聊了聊

周图灵奖得主 Yann LeCun 认为真正的智能应能在脑海推演,而语言模型难以触及真实世界。2026 年初,蚂蚁灵波连续四天开源四款具身智能模型,探索从物理交互构建智能的新路径。

机器之心
推荐文章7

Sebastian Raschka 2026预测:Transformer统治依旧,但扩散模型正悄然崛起

知名AI研究员Sebastian Raschka预测2026年,Transformer架构在未来至少一到几年仍占统治地位,但会在效率和混合微调。同时,扩散语言模型虽有工具调用缺陷,但在数据稀缺时或成更好的学习者。

机器之心
新闻资讯7

AI月产十亿行代码,暴增76%!程序员论坛炸锅:代码行数≠生产力!

Greptile基于每月用AI审核的十亿行代码发布AI编程年度报告,显示AI助力下代码生产量飞涨,但论坛对此多存怀疑,还分析了不同模型SDK下载量、模型适配场景等,也给出2025年关键论文。

新智元
新闻资讯8

直击CES:黄仁勋演讲后4个小时,苏姿丰带着她的“复仇者联盟”台了|甲子光年

CES 2026,英伟达CEO黄仁勋演讲后约4小时,AMD董事长苏姿丰登场,展示全栈AI战略。发布Helios架构、新GPU产品及Ryzen AI平台等,走系统工程与长期演进路线,欲抢AI基础设施市场。

甲子光年
新闻资讯7

GPT5.5代号“蒜你狠”曝光!OpenAI拉响红色警报加班赶制新模型,最快下周就发

面对谷歌攻势,OpenAI奥特曼拉响“红色警报”,集中资源让ChatGPT赶Gemini 3 Pro。两款新模型曝光,一款下周发布,代号Garlic的明年初或发。ChatGPT流量降,OpenAI财务压力,Garlic能否助其破局受关注。

量子位
新闻资讯7

AAAI 2026结果公布,刷出88887高分!2.3万投稿录用率仅17.6%

AAAI 2026录用结果公布,投稿量达23,680篇创历史新高,录用率仅17.6%。多位研究员论文被录用,如北顾怿洋、南洋理工加小俊等。同时,Reddit对此次录用讨论热烈,有人质疑存在‘关系户’现象。

新智元
开源动态7

DeepSeek-OCR降本增效,10×暴力压缩还能读得清

Deepseek - OCR模型发布,通过光学压缩技术解决长文本处理的计算效率问题,能控制模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。

CourseAI
新闻资讯7

The Batch: 858 | 白宫重塑美国人工智能政策

特朗普提出积极的国家人工智能政策原则并推动实施,《赢得竞赛:美国人工智能行动计划》明确三短期目标,包括激发创新、建设基础设施、确立全球领导地位,与拜登政府政策有差异。

DeeplearningAI
新闻资讯7

AI圈水太深:OpenAI保密、Meta作弊!国产MoE却异军突起

文章梳理语言模型发展,从传统稠密架构到稀疏MoE架构,参数从百亿到万亿。介绍OpenAI、Meta等厂商模型,如GPT系列、Llama系列,还提及Mixtral、DeepSeek V3等。指出Meta作弊丑闻,国产MoE模型异军突起。

新智元