「上科大」共找到 6455 篇相关文章
Transformer创新架构SALA:上下文更长,推理更快
面壁智能发布行业首个大规模训练的稀疏 - 线性注意力混合架构 SALA 及文本模型 MiniCPM - SALA。该架构降低推理开销与显存占用,MiniCPM - SALA 在长文本处理及推理上表现出色,还发起大奖赛探索性能极限。
智能必须基于世界模型?我们和蚂蚁灵波团队聊了聊
上周图灵奖得主 Yann LeCun 认为真正的智能应能在脑海推演,而大语言模型难以触及真实世界。2026 年初,蚂蚁灵波连续四天开源四款具身智能模型,探索从物理交互构建智能的新路径。
Sebastian Raschka 2026预测:Transformer统治依旧,但扩散模型正悄然崛起
知名AI研究员Sebastian Raschka预测2026年,Transformer架构在未来至少一到几年仍占统治地位,但会在效率和混合上微调。同时,扩散语言模型虽有工具调用缺陷,但在数据稀缺时或成更好的学习者。
AI月产十亿行代码,暴增76%!程序员论坛炸锅:代码行数≠生产力!
Greptile基于每月用AI审核的十亿行代码发布AI编程年度报告,显示AI助力下代码生产量飞涨,但论坛对此多存怀疑,还分析了不同大模型SDK下载量、模型适配场景等,也给出2025年关键论文。
直击CES:黄仁勋演讲后4个小时,苏姿丰带着她的“复仇者联盟”上台了|甲子光年
CES 2026上,英伟达CEO黄仁勋演讲后约4小时,AMD董事长苏姿丰登场,展示全栈AI战略。发布Helios架构、新GPU产品及Ryzen AI平台等,走系统工程与长期演进路线,欲抢AI基础设施市场。
GPT5.5代号“蒜你狠”曝光!OpenAI拉响红色警报加班赶制新模型,最快下周就发
面对谷歌攻势,OpenAI奥特曼拉响“红色警报”,集中资源让ChatGPT赶上Gemini 3 Pro。两款新模型曝光,一款下周发布,代号Garlic的明年初或发。ChatGPT流量降,OpenAI财务压力大,Garlic能否助其破局受关注。
AAAI 2026结果公布,刷出88887高分!2.3万投稿录用率仅17.6%
AAAI 2026录用结果公布,投稿量达23,680篇创历史新高,录用率仅17.6%。多位研究员论文被录用,如北大顾怿洋、南洋理工加小俊等。同时,Reddit上对此次录用讨论热烈,有人质疑存在‘关系户’现象。
DeepSeek-OCR降本增效,10×暴力压缩还能读得清
Deepseek - OCR模型发布,通过光学压缩技术解决长文本处理的计算效率问题,能控制大模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。
The Batch: 858 | 白宫重塑美国人工智能政策
特朗普提出积极的国家人工智能政策原则并推动实施,《赢得竞赛:美国人工智能行动计划》明确三大短期目标,包括激发创新、建设基础设施、确立全球领导地位,与拜登政府政策有差异。
AI圈水太深:OpenAI保密、Meta作弊!国产MoE却异军突起
文章梳理大语言模型发展,从传统稠密架构到稀疏MoE架构,参数从百亿到万亿。介绍OpenAI、Meta等厂商模型,如GPT系列、Llama系列,还提及Mixtral、DeepSeek V3等。指出Meta作弊丑闻,国产MoE模型异军突起。