「LLaDA2.1」共找到 3267 篇相关文章
究竟会花落谁家?DeepSeek最新大模型瞄准了下一代国产AI芯片
近期,DeepSeek发布V3.1新模型,采用全新混合推理架构,在多任务表现上有提升。它采用UE8M0 FP8,或为国产推理芯片优化机制。国内多家厂商新一代AI芯片支持FP8,未来国产大模型或针对其专门优化。
阿里一口气发了N款新模型,让我们向源神致敬。
阿里云栖大会发布众多模型,有Qwen3 - Max、Wan2.5等。Qwen3 - Max对标顶尖模型;Wan2.5支持音画同出;Qwen3 - VL是强大视觉语言模型且已开源;Qwen3 - Omni是全模态模型。此外还有多个新模型,构建全场景生态。
Anthropic刚发布了一份「AI抢饭碗报告」:学历越高越「被抢」
Anthropic《经济指数报告》揭示,任务越复杂AI加速越猛,学历高的工作受影响大。还指出人机协作能大幅提升任务时长,不同国家AI应用有贫富和技术代差,也提到了‘去技能化’问题及对生产率的预测。
CuteDSL-2: 基本操作
文章为Cute - DSL第二篇,整理官方notebook介绍基本操作。涵盖数据类型、张量、结构体等基本操作,还介绍了控制流(For、If - Else、While循环等)及TensorSSA的相关操作,如LD/ST、运算、切片等。
Prompt三则(2)
文章给出三则Prompt。一是找行业‘老司机’俯瞰行业,设定前辈身份,强调实用指引;二是穿透语言看‘内核特质’,如剥洋葱般挖掘;三是将一句话‘画面化’,让抽象概念成感官盛宴。
2w+ star,和claude对着干,牛皮!
Anthropic 给 Claude 生成文字添加水印,方式独特且难去除。`watermarks-remover` 项目应运而生,针对不同水印机制分层处理,兼容多格式文件,有多种安装使用方式,还明确告知能力边界。
5.2万星项目Ghostty逃离GitHub!
广受欢迎的开源终端Ghostty将离开GitHub,其创造者Mitchell Hashimoto称GitHub故障频发,严重妨碍工作。此事引发开发者共鸣,有人剖析原因指向运营策略和AI自动化泛滥,也让其他开发者心生去意。
分享2篇OpenClaw最新Skill论文~
OpenClaw作为最大开源Agent框架,其Skill生态安全受关注。分享两篇论文,《Clawdrain》揭示Token耗尽攻击,《SkillFortify》提出形式化防御框架,从攻防维度揭示OpenClaw深层安全风险。
CUTLASS 笔记 (2):混合精度 GEMM kernel
文章介绍实现支持不同精度的 GEMM 算子,解析精度转换技术细节,还介绍根据 PTX 文档实现自定义 FP8 精度的 GEMM kernel,包括揭开 MMA Atom 面纱、分析 TV 与 MN Layout 等,最后完成精度验证。
kimi 的RL end2end ON LLM
文章分享Kimi Researcher背后技术思考,采用端到端强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。