「低熵模型」共找到 8303 篇相关文章
Meta Shuffling的MoE Grouped GEMM kernel benchmark
作者拷贝fbgemm开源的moe grouped gemm kernel,修复小bug后与SGLang的Grouped GEMM Triton Kernel对比,结果显示fbgemm在MoE模型上性能提升显著,可应用到SGLang的ep - moe的grouped gemm kernel中。
“同事.skill”不用写了,爱马仕 Hermes 主动“蒸馏”你,还让开发者集体抛弃 “龙虾”?!
近日,Hermes Agent 在国内爆火,获超 3.9 万 stars。它是单 Agent 架构,核心是学习循环,记忆分层管理。其网关功能强大,状态可跨会话留存。背后的 Nous Research 目标是打造抗衡 OpenAI 的开源模型,还引入区块链解决算力问题。
开源「活人感写作.skill」,只为帮你写出没有AI味的文字。
作者开源活人感写作.skill,旨在帮大家写出无AI味文字。它适配多种模型和产品,鼓励用真实经历创作,除了去除辞章端AI口癖,还会激发思想、验证事实,让大家保留自我。
DeepSeek秘密造芯!专攻推理,一年前已启动,招聘全程不公开
路透社消息,凭借算法震动硅谷的中国AI公司DeepSeek正秘密开发自研AI芯片,定位推理,项目约一年前启动,现处早期。全球模型公司自研芯片成趋势,虽挑战大,但DeepSeek有资金支撑。
Nature重磅:图灵预言的AGI早已实现,人类却不敢承认!
《自然》杂志新评论文章称,UCSD研究团队系统论证AI已真正“通用”。当前大语言模型如GPT已展现广域人类级智能,已达专家水平,研究团队还驳斥了对AGI的十大异议。
估值1亿的"死了么"APP有多好抄?5分钟AI就能复刻,去年有人一下午做出原型
‘死了么’APP 爆火并更名 Demumu,虽开发成本低却估值达 1 亿。此前有数据分析师曾用 AI 5 分钟复刻其海外版。该 APP 由三名 95 后开发,现下载量猛增,还面临竞品挑战。
这一年,DeepSeek消耗14万亿Token,编程仅占1/10,超一半用于角色扮演?
a16z和OpenRouter基于100万亿token研究揭示LLM使用情况:开源模型占三成市场,编程任务成刚需,角色扮演是金矿。还提到‘玻璃鞋效应’影响用户留存,市场分层为‘高端闭源+性价比开源’双轨制。
我写 nano banana pro 提示词时的原则和策略
作者分享写 nano banana pro 提示词的原则与策略,原则是做成模板、结合模型能力;策略是先跑通原型再抽象成模板;不过度精简提示词,还介绍用 GPT-5.1 等工具辅助。
刚刚,Claude Sonnet 4.5重磅发布,编程新王降临!
北京时间今天凌晨,Anthropic发布Claude Sonnet 4.5,被定义为全球最强代码模型。它在多方面有显著突破,Anthropic还对全线产品更新,其在多项测试表现出色,且对齐性更好、更安全。
腾讯开源智能体构建框架
腾讯开源智能体构建框架 Youtu-Agent,灵活高性能,验证性能出色,开源友好成本低。有自动智能体生成等亮点,适用于不同用户群体,涵盖研究、开发等场景,还介绍核心概念,附项目地址。