「前馈模型」共找到 8224 篇相关文章
燃尽、重启、爆火:Clawdbot 创始人的 35 分钟访谈实录
本文是 Clawdbot 创始人 Peter Steinberger 的访谈实录。他曾经营 PSPDFKit 13 年,后经历三年倦怠期。2024 年受 Claude Code 启发,10 天做出 Clawdbot,几周内 GitHub 星标近 9 万。还谈及模型看法、改名风波及产品前景等。
从宁波走出来的芯片首富,累计捐赠近百亿
我国芯片业前首富虞仁荣再次给宁波东方理工大学捐款,价值超36亿。此前他已多次捐赠,累计兑现近百亿。虞仁荣出身宁波,创办韦尔股份,并购豪威科技,带出千亿芯片巨头,还热衷慈善回馈家乡。
10人团队千万融资,这个原生AI产品要做“人人可用的数据Agent”丨对话ChatExcel
ChatExcel是国内首款原生AI DataAgent,专注自然语言对话处理分析数据。其不到10人团队获近千万融资,定位平民化数据产品,核心是多模型结合,已近百万用户,正拓展海外市场。
Karpathy「疯狂之作」:100美元、4小时,就能训练你自己的「小型GPT」
AI传奇人物、前特斯拉AI总监Karpathy推出开源项目「nanochat」,以不到8000行代码复现ChatGPT全流程,只需一台GPU、约4小时、成本仅百美元。项目在GitHub上线不到12小时获4.2k星标。
追平GPT-4o,数学基测96.3%高分,Hermes4 来了
Nous Research推出新一代大模型Hermes 4系列,其有混合推理和长度控制机制,还能用DataForge“造”数据,经Atropos质检。它在数学等领域表现佳,追平GPT - 4o,是开源AI对巨头的挑战。
OpenAI女CEO太狠了!智商148,GPT-5才是真印钞机
GPT-5智商高达148,在多基准测试表现亮眼获英伟达认可。OpenAI借“路由器”为ChatGPT商业化铺路,它能分流降成本、让免费用户接触深度思考模型,还可变身广告分配器,实现AI广告变现。
上海又要冲出一个百亿芯片IPO
近日,瀚博半导体与中信证券签署上市辅导协议,冲刺A股科创板。其由前AMD核心技术领袖钱军、张磊创立,选差异化技术路径,已历6轮融资。当前国产GPU IPO潮起,瀚博有望借此抢占市场。
长上下文不再难:KV Cache 全生命周期优化实战
长上下文大语言模型发展带来计算和内存挑战,现有基准测试多忽视 KV 缓存完整生命周期。微软姜慧强在 AICon2025 分享 SCBench 工具,梳理推理优化方法,介绍 MInference 等,还提出 Tri - shape 方法等成果。
扣子要做 Agent 时代的 Infra,附开源版搭建全流程
扣子宣布开源 Coze Studio,后端用 Golang,前端用 React 和 TypeScript,基于微服务架构。借助火山引擎 ECS 可一键部署,还能更换自定义模型。官方表示开源是为顺应趋势、确保安全及获开发者反馈。
训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO
混元基础模型团队提出全新框架MixGRPO,结合SDE和ODE,简化MDP优化流程,提升效率与性能。还推出更快变体MixGRPO - Flash。MixGRPO训练时间降近50%,MixGRPO - Flash再降71%,效果和效率优于DanceGRPO。