「模型使用经验」共找到 8935 篇相关文章
非Transformer架构落地之王,带着离线智能和原生记忆能力在上海WAIC浮出水面
在上海WAIC现场,RockAI展台的机器狗和灵巧手在离线状态表现出色,背后是其非Transformer架构的大模型Yan 2.0 Preview,有原生记忆和离线智能能力。该公司成立两年,押注此架构,产品已商业落地,还构想群体智能未来。
禁令之下,黄仁勋再用“阉割芯片”抢夺中国市场
美国芯片出口管制冲击英伟达,其在中国市场损失大、份额降。黄仁勋计划7月推‘阉割芯片’B20、B40/B30抢市场。不同客户有选择倾向,同时国产GPU有机会也面临难题,企业还尝试海外训练模型。
GPT-5两周内发布,内测猛料流出?GPT-6或已开始训练,奥特曼剧透百万GPU
有爆料称GPT-5将在两周内发布,是多模型组成的系统,含「路由器」,GPT-6已在训练。奥特曼称年底将增超百万GPU,有人看好GPT-5,也有人认为它可能只是路由器。此外,OpenAI有十名员工拒小扎3亿天价offer。
Hermes Agent 技术深度拆解:36000 Star 背后的架构设计,以及你该怎么用它
Hermes Agent 9 个月获 36800 Star,解决记忆断裂、能力天花板和平台绑定问题。它有四层记忆架构、自主技能进化,支持 200+ 模型,还有 40+ 内置工具、15 个平台适配器。最新 v0.8.0 版本有多项更新,文章还给出使用建议和对比。
YC点名创业方向:AI欺诈猎手,可能干掉整个反欺诈行业!
2026年春,YC发布的RFC清单中,‘政府欺诈猎手基础设施’引发关注。传统反欺诈存在‘非对称竞争’,而智能体技术为防守方带来翻盘机会。构建AI原生业务模型,可让防守方获结构性优势,但要解决安全与合规问题。
10万字Claude系统提示词泄露!我用DeeSeek 将它翻译成了中文版
Claude完整系统提示在GitHub泄露,虽真假未确认,但值得分享供参考。作者用DeepSeek将其翻译成中文版,该提示涵盖模型行为、工具使用等多方面,设计精妙全面,是AI交互设计“百科全书”,对提示词工程师极具学习价值。
Gemini 3.5 Pro绝密泄露,前端赶超Fable 5!
全网被Gemini 3.5 Pro泄露刷屏,传闻7月17日发布。它在前端生成表现出色,一次成型、精准零失误,性能超Fable 5,但在硬核推理等任务上不如Fable 5和GPT - 5.6。谷歌为其重预训练,还准备对标GPT - Image 2的图像模型。
Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?
OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌Deepmind推Genie 3,Anthropic放出Claude Opus 4.1。Claude Opus 4.1编程性能提升,实测编码能力强于gpt - oss。gpt - oss虽有亮点,但幻觉率高、实测效果不佳。
全球看中国,灵初智能用10万小时人类数据写下具身智能的中国答案
2026年,“世界模型”成具身智能高频词。灵初智能联合创始人陈源培认为其非核心方向,而是数据迁移工具。灵初关注人类操作数据转化,在10万小时量级上可大幅替代真机数据,还介绍了系统模块、数据集及商业化阶段等情况。
SAPO:让强化学习告别“硬剪切”
强化学习是提升大语言模型推理能力的核心技术之一,但现有基于组的策略优化方法面临 token 级重要性比率高方差问题。GRPO 和 GSPO 采用硬剪切有学习信号丢失等缺点。为此提出 SAPO,用平滑门控函数替代硬剪切,实验效果良好。