「后处理」共找到 2816 篇相关文章
R1/Qwen训练新范式:无需继续训练,直接“算”出权重,提效500%
DeepSeek - R1爆火让RLVR成大模型后训练焦点,但训练代价高昂。学者发现RLVR中LLM权重和输出概率呈线性变化,提出“权重外推”等方法,实现最高6.1倍训练加速,RL - Extra在多榜单展现高效率。
Qoder @database功能上线!自动关联数据库 Schema,后端 AI Coding 效率拉满
Qoder JetBrains插件上线@database功能,将数据库能力内置为核心上下文,可一键让AI结合真实业务表结构处理SQL编写等任务。它是JetBrains上唯一深度支持“数据库原生感知”的AI Coding插件,还介绍了使用方法、场景及注意事项。
开源框架让代码AI偷师GitHub!bug修复率飙升至69.8%,性能创纪录
MemGovern团队联合多高校团队提出MemGovern框架,将杂乱GitHub数据转化为AI可用的结构化记忆。它构建筛选净化流水线,采用先搜后看模式,实验显示能显著提升代码智能体的bug修复率,还具跨领域推广价值。
“不是...而是...”刷屏的一年,我读内容的快乐被AI偷走了。
作者补完《怪奇物语》后看B站解说视频,因文案中“不是...而是...”句式不适,由此探讨人们讨厌AI生成内容的原因,指出其像新时代八股文,还提及全球对AI内容的不信任,呼吁保持与他人的真实连接。
独家对话 Looki 创始人孙洋:摸着自己过河
本文是对Looki创始人孙洋的独家专访。Looki L1发布后意外大火,但前期市场策略保守,未突出AI。用户使用时长超预期,产品隐私设计消除担忧。团队在供货、软件迭代等方面不断探索,商业模式也在摸索中。
8B模型任务击败GPT-5?阶跃星辰开源Deep Think新框架,小模型解锁百万Token测试时计算
阶跃星辰推出并行协同推理框架PaCoRe,让大模型突破上下文窗口和处理速度限制。基于此框架,小模型能解锁百万级Token测试时计算。PaCoRe - 8B在数学基准测试中超越GPT - 5,还具备前沿性能、“综合”能力涌现等优势。
中国算力方案:如何用有限资源做出无限可能?|甲子引力
2025年12月3日,「甲子光年」举办年终盛典,在算力产业专场,分析师王艺对话多位嘉宾,探讨中国算力方案。面对算力困境,嘉宾分享突破策略,还就关键瓶颈、技术路径等展开交流,认为具备场景洞察等优势才能持续突破。
谷歌卷土重来:你大爷还是你大爷
上周谷歌横扫科技媒体头条,传闻Meta考虑换谷歌TPU致英伟达市值蒸发,过去一月其缩水6000亿,谷歌涨5000亿。此前被看衰的谷歌,发布Gemini - 3及三季报后强势回归,TPU外供挑战英伟达地位。
“中国英伟达”,离上市只差临门一脚
摩尔线程、沐曦等国产AI芯片企业距上市仅一步之遥,部分已在港交所提交申请表。企业闯关IPO面临诸多挑战,成功可获资金,失败或“失血而死”。上市后有望造富,也面临市场竞争,最终谁胜出要看生态构建。
谁押中了「国产GPU四小龙」?
今年10月英伟达因出口管制退出中国市场,国产GPU厂商迎来「上市潮」。「国产GPU四小龙」燧原科技、壁仞科技、摩尔线程和沐曦股份受关注,本文梳理其投资情况,涉及早期伯乐、各方投资意图及上市前景等。