「高效推理框架」共找到 3722 篇相关文章
卡帕西8000行代码手搓ChatGPT,成本仅100美元,训练12小时CORE表现超越GPT-2,手把手教程来了
AI大神Andrej Karpathy新作nanochat,用8000行代码、100美元成本纯手搓克隆ChatGPT。它是极简全栈训练/推理pipeline,训练12小时,CORE表现超GPT - 2,还给出快速上手详细指南。
腾讯混元图像3.0开源榜一,工业级800亿参数可商用,附提示技巧
28日,腾讯开源800亿参数的工业级原生多模态生图模型HunyuanImage 3.0,个人和月活≤1亿公司可免费用。它是全球参数量最大、性能最好的开源图像生成模型,技术强、评估表现优,官方还整理了提示词手册。
Claude Code被攻破「后门」,港科大&复旦研究曝出TIP漏洞
近期港科大与复旦研究指出,Claude Code命令行工具连接MCP服务器时,TIP可能被劫持致远程代码执行。研究用TEW框架测试验证漏洞,还给出真机案例,最后提出改进方向。
谷歌DeepMind曝光首个“AI 经济体”完整架构,Agent催生全新经济体正在悄然成形
谷歌DeepMind论文描绘由AI Agent自主交易和协作的经济体,提出“沙盒经济”框架,分析其起源与隔离程度,指出发展方向及挑战,还给出应用场景、市场机制、设计方案、基础设施层和行动建议。
长视频生成可以回头看了!牛津提出「记忆增稳」,速度提升12倍
牛津大学团队提出VMem,把「看过什么」写进几何小片,用基于3D几何的记忆索引替代短窗上下文,实现「一致性更强、资源更省、速度更快」,实测速度比常规管线快约12倍。
DeepSeek 官宣V3.1:迈向 Agent 时代的第一步!
DeepSeek 官宣发布 V3.1,称这是迈向 Agent 时代第一步。其有混合推理模式,Agent 能力全面进化,API 也全面升级,支持 Anthropic API 格式。还继续开源,9 月 5 日起调整价格,社区反响热烈。
多突触神经元模型问世,国内团队打造类脑计算新引擎,登上《自然·通讯》
当前人工智能高能耗问题凸显,脉冲神经网络被认为更具生物合理性、能效更高,但缺乏平衡计算效率和生物合理性的脉冲神经元模型。国防科技大学与中科院团队合作提出 MSF 脉冲神经元模型,相关研究发表于《自然・通讯》。
AI 如何“征服”美国经济:一份图文并茂的常见问题解答
美国经济已分化为火热的 AI 经济和萎靡的消费经济。AI 领域支出、股市表现、商业数据都体现其热度。顶尖科技公司因丰厚利润大力投入 AI 基建,但目前盈利不明,员工对 AI 提升生产力看法不一。
Remix 3终结以React为中心的架构
多年来,React 一直是全栈 JavaScript 架构基础。但 Remix 3 挑战了这一局面,它遵循渐进式增强和服务器优先原则,将 Web 基本原理置于核心,重新定义构建方式,引发对 React 中心架构的思考。
DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO
论文指出GRPO在大语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,在Qwen3上效率更高。