后Transformer架构」共找到 3710 篇相关文章

新闻资讯7

「AI大模型时代的CIO」云栖专场: AI实战者与落地破局者的坦白局

云栖大会「AI大模型时代的CIO」专场,探讨企业AI落地难题。虽搭上AI电梯是趋势,但企业落地有不确定性,如组织架构不匹配等。多位实战者分享经验,给出RIDE等解法,助企业破局。

阿里云开发者
产品应用8

快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!

近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面训练流程等创新,实现视频理解突破,综合性能领先。

深度学习自然语言处理
新闻资讯7

Altman拿Token换股权只够烧45天,20亿Token捐母校只值100块:Token真成“钱”了,谁更赚?

本文围绕AI Token展开,讲述OpenAI用Token换创业公司股权,00捐20亿Token给母校,还探讨了“tokenmaxxing”现象及问题,指出AI行业经济账未算清,企业客户成本高,AI成管理层压迫工具。

InfoQ
开源动态7

小模型也能精确计算:WorldModel-Qwen的推理时代码执行实验

开发者bigattichouse让Qwen - 0.6B小模型推理时生成并执行WASM代码获计算结果。最初尝试加标签生成Python代码效率低,用WASM,创建三层架构。虽结果未完美,但接近,还通过Gemini审查验证。

AI工程化
开源动态8

HF日趋榜一!真端到端模型AutoDeco终结手动调参解码

大语言模型手动调参解码繁琐,腾讯AI Lab王琰团队联合港中大(深圳)唐晓莹教授团队推出AutoDeco架构,通过创新训练策略让模型动态预测解码参数,在多模型实验中表现出色且已开源。

机器之心
技术分析类文章7

Pingpong Schedule并不是万能钥匙

SGLang社区开发者反馈,SM90 FP8 Blockwise Scaling Grouped GEMM从H20迁移至H800性能下降。文章分析是Pingpong调度策略所致,因算力提升,其使TensorCore未充分利用、TMA效率低,建议用Cooperative策略。

GiantPandaLLM
新闻资讯8

全球首份大模型业绩报!MiniMax预判2026三大超级PMF,AI平台公司启程了

港交所上市52天,MiniMax交出IPO首份年报,2026年2月ARR突破1.5亿美元,2025年营收同比增158.9%,毛利飙升437%、亏损率收窄。它产品密集迭代,还预判2026年有三个超级PMF,欲成AI平台型公司。

量子位
推荐文章7

AI 时代的洞察方法论:结构化思维与能力迁移

文章以高盛数字化架构设计为例,探讨AI时代技术分析的能力迁移。指出AI使信息采集整合成本降低,技术分析重心从找信息转向构建模型,建模仍是洞察主战场,AI可加速知识铺垫,但模型切换需人类完成。

phodal
推荐文章8

从《塞尔达传说》理解 Agent 的上下文工程:Claude Skills 还是被低估了

Claude Skills 是为 AI 设计的「技能包」,能把复杂任务指令打包。作者认为其信息分层设计哲学是关键突破,以《塞尔达传说》为例,介绍了信息分层和按需加载理念,还阐述了三层架构及应用案例、挑战和通用原则。

Founder Park
7

刚刚,「吉卜力狂欢」GPT-4o功臣被挖走!华南理工女学霸曾与奥特曼同台

GPT-4o引爆全球「吉卜力风格」风潮,其核心成员华南理工学霸Lu Liu与伯克利博士Allan Jabri跳槽Meta。此前他们在OpenAI主导多模态AI研究,与奥特曼同台展示关键功能,此次挖角凸显OpenAI人才流失危机。

新智元