文心大模型 X1.1」共找到 8450 篇相关文章

开源动态7

GPU-MODE Leaderboards之vector_add histogram 以及一些有趣发现

文章介绍GPU-MODE Leaderboards中vector_add和histogram任务。分析vector_add实现、带宽利用率,rank1代码用cccl,带宽利用率超80%;histogram算子瓶颈在atomic冲突等,rank1也多用cccl,还给出rank2代码,最后提及任务中Hack行为及代码提交方式。

GiantPandaLLM
开源动态8

百度Qianfan-VL开源,纯国产自研昆仑芯跑出世界一流

百度开源全新视觉理解模型Qianfan-VL,有3B、8B和70B三个版本,在昆仑芯P800芯片上训练。该模型多模态能力强,OCR和教育场景表现突出,跑分超国际主流模型。芯片功耗低、架构优,模型训练方法创新。

AIGC开放社区
推荐文章8

GPU-MODE Leaderboards之nvfp4_gemv代码阅读

文章围绕GPU-MODE的nvfp4_gemv竞赛rank1代码展开,先介绍问题及官方baseline,后详细解读rank1代码,含数据加载、线程模型等,还剖析核心计算函数,最后总结代码在缓存控制、数据格式等方面的调优亮点。

GiantPandaLLM
开源动态8

第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力

新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型

新智元
产品应用8

千问Qwen旗舰预览版Qwen3.6-Max-Preview发布

千问Qwen发布下一代旗舰模型早期预览版Qwen3.6 - Max - Preview,在权威评测中登顶最佳国产模型。此前开源的Qwen3.6 - 35B - A3B用30亿激活参数匹敌数百亿参数稠密模型,新模型在多方面给出技术演进方向。

AIGC开放社区
算法论文8

牛津、NUS提出下一代世界模型方向:心智世界模型来了

牛津大学和新加坡国立大学研究团队提出心智世界建模(MWM)通用框架,将心智变量纳入世界状态。还实现基准系统 MENTIS 验证其有效性,实验表明 MWM 对预测人类决策必要,瓶颈是状态转移模拟能力不足。

机器之心
开源动态7

Kimi K2基于DeepSeek V3构建

从Hugging Face模型配置文件可知,月之暗面未设计全新模型结构,而是选Deepseek V3作基座模型,用自身高质量数据、独特方法做大量‘微调’和‘后训练’。

AI寒武纪
开源动态8

一个For循环就是全部:BU开源了它的Agent框架

Browser Use团队开源bu - agent - sdk,设计理念简单,Agent就是一个for循环。它减少抽象、最大化模型自由度,解决了传统框架行动空间不完整等问题,支持多模型,开发者可自由选模型

AI工程化
算法论文8

天文预测新SOTA!紫东太初&国家天文台联手攻克恒星耀发难题

紫东太初与中国科学院国家天文台联合开发天文耀发预测大模型FLARE,能精准预测恒星耀发事件。该模型整合恒星物理属性和历史耀发记录,提升预测准确性,相关论文被IJCAI 2025录用。

量子位
算法论文8

生成视频总出物理bug?用VLM迁移+token级对齐,让燃烧在正确位置发生,碰撞遵循动量守恒丨CVPR 2026近满分接收

现有生成式视频模型多停留在“外观拟合”,未真正“物理建模”。中山大学等机构提出ProPhy,构建渐进式物理对齐框架,使模型有“分层物理理解”与“空间物理对齐”能力,论文被CVPR2026近满分接收。

量子位