「统一模型架构」共找到 8617 篇相关文章
Transformer上限触顶,Mobius能否引发下一代模型架构的革命?
自ChatGPT问世,Transformer上限备受关注。前OpenAI、Google负责人称其走到尽头。国内改进架构受算力限制。上海人工智能实验室的书生Mobius团队提出分离知识与推理的架构,有望解决商用等关键问题。
谷歌向左、李飞飞往右,阿里世界模型「快乐生蚝」杀出第三条路
阿里推出世界模型HappyOyster(快乐生蚝),基于原生多模态架构,有漫游和导演两大核心功能,可实时构建和交互。与文生视频模型不同,它能随时被干预。虽世界模型尚处早期,但应用场景广泛。
时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。
去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。
现有AI都是假实时!Thinking Machines发布交互模型,离真正的贾维斯真的近了
Thinking Machines发布交互模型,切入与AI交互方式问题。该模型能原生支持实时交互,由交互和后台模型组成。架构设计独特,解锁多项功能,评测表现佳,但也存在长会话、计算部署等局限。
深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知
多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。
小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源
微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。
深度讨论新一轮模型发布:当智能进入月更时代 | Best Ideas
近期全球模型迎来高密度发布期,Anthropic、OpenAI、腾讯、DeepSeek 等纷纷推出新模型。文章复盘了 Opus 4.7、GPT - 5.5、DeepSeek V4 等模型实测体验,探讨架构变化、能力边界与产业影响,还分析算力、token 价格等问题。
安全垂类小模型效果能超过大模型?看看以色列Novee的效果
跟踪AI渗透测试等开源应用发现,通用大模型成本高、功能受限。以色列Novee融资5150万美元并发布4B小模型,测试效果超Claude 4 Sonnet。其靠两阶段训练和浏览器反馈提升能力,有投资说明有价值。
世界模型和具身大脑最新突破:90%生成数据,VLA性能暴涨300%|开源
国产世界模型玩家获突破,VLA模型性能涨300%,90%训练数据由世界模型生成。极佳视界开源GigaWorld - 0及训练框架,在多方面优化,经对比性能领先,还验证其生成数据对具身任务的提升作用。
Moonshot AI发布Kimi Linear技术报告,采用混合线形注意力架构
Moonshot AI在Hugging Face发布Kimi Linear技术报告,该48B参数模型采用混合线性注意力架构,称超越传统全注意力机制。官方数据体现其优势,模型已开源,社区反应不一,MiniMax则回归全注意力架构。