「大模型开发」共找到 10200 篇相关文章
八年后,Meta教会了Transformer「显式思考」
10月20日Meta上线新论文《The Free Transformer》,作者François重写Transformer思维方式,造出Free Transformer新架构。它在解码器内加入随机潜在变量,让模型生成内容前先‘思考’,实验显示在多任务上性能显著提升。
重生之在《我的世界》做山姆·奥特曼:网友在线手搓ChatGPT
一老哥在《我的世界》上手搓出有500万个参数的ChatGPT,经英语对话训练,能在像素世界小电脑上对话,用红石电路和存储单元搭建,未用指令集,网友还在游戏里开发出诸多东西。
这个世界越来越科幻了:OpenAI 发布 AI 超级助理 Plus,Gemini 发布有了真正的“思考力” 的机器人
OpenAI发布ChatGPT Pulse,它基于个人信息主动分析兴趣、梳理日程,预测需求并推送资讯或建议,像懂心思的私人助理。谷歌DeepMind推出Gemini Robotics 1.5,让机器人有自主‘思考’能力,其ER 1.5模型预览版上线。
提示工程死亡?不,它刚刚重生为计算科学:一篇讲透Prompt设计的科学基础
大型语言模型在多步推理任务中受挫,因Transformer架构有计算深度限制。本文建立提示设计理论框架,揭示提示是信息选择器,优化提示可使推理性能提升超50%,将提示设计从试错艺术变为可计算科学。
韩松贾扬清之后,又一家清华系AI公司卖给英伟达,黄仁勋亲自招募95后联创
继韩松、贾扬清后,又一家清华系AI公司Nexusflow被英伟达收购。黄仁勋招募其联合创始人,公司成果亮眼,如开源模型表现超GPT - 4等,这或与生态联系有关,收购也是英伟达活跃布局的一环。
「推理革命」爆发100天:DeepSeek-R1复现研究全揭秘!
本文深入梳理围绕DeepSeek-R1的复现研究,解析监督微调、强化学习等关键技术细节,介绍相关数据集、训练方法及奖励机制等,还探讨了推理语言模型更多发展方向,为研究提供基础。
企业官网GEO优化实操:如何让AI主动推荐你的官网?
本文作者白杨SEO从2011年入行SEO,2024年起研究AI搜索优化。他指出当下AI平台引用来源变化大,企业官网成重要来源。作者从网站代码、站内内容、站外推广三方面,教大家做好官网GEO优化,让AI推荐官网。
影身智能完成多轮融资,用原生3D数据重新定义机器人认知|甲子光年
影身智能已连续完成多轮融资,累计近亿元。其以‘原生3D动态世界模型’为核心技术,采用与市场不同的‘升维’思路,用自研的‘影身360’系统采集3D数据,还落地柔性智造行业,目标是打造通用人工智能产品。
超越DeepSeek-R1,数学形式化准确率飙升至84% | 字节&南大开源
字节跳动Seed团队与南京大学联合发布CriticLean框架,将数学自然语言到Lean 4代码的形式化准确率从38%提升至84%。该框架创新性地将评估模型置于核心,解决语义对齐等问题,还构建了相关基准测试和数据集。
华人学生立大功!新王Mamba-3直击Transformer死穴,推理效率碾压7倍
新一代开源架构Mamba-3发布,由CMU普林斯顿原班人马打造,15亿参数性能比Transformer高4%,长序列任务端到端延迟仅为其七分之一。它采用新设计哲学,推理优先,有三大核心技术,还能与自注意力层混合提升检索能力。