「模型训练与微调」共找到 8163 篇相关文章
Ilya的第一个模型,被曝本月上线
新智元报道,投资人Gavin Baker称Ilya Sutskever创立的SSI本月将发布首个模型。他还提及持续学习等技术或影响英伟达显卡需求,且指出Claude成华尔街“克朗凯特”,带来市场共识同质化。
实测Kimi全新Agent模型「OK Computer」,很OK
Kimi发布全新Agent模型「OK Computer」,依托Kimi K2,能搭网站、做PPT、处理大量数据。实测显示它在设计、生成、分析类任务表现不错,设计无需找素材,分析无需想角度,生成还能推荐风格。
什么!我把SQL编辑器装进了大模型?
文章介绍基于约束解码技术,结合CFG、Jinja模板和XGrammar框架,为大模型SQL生成配备“编辑器”。它能保证语法正确、遵循规则,还具灵活性。但面临约束干扰和性能瓶颈,未来可简化配置惠及更多用户。
魔搭社区想做的,不只是模型平台
首届魔搭开发者大会在北京举行。魔搭社区发起人周靖人发布开发者勋章激励计划,是对「MaaS」理念的延展升级。魔搭已汇聚超500家机构,发布超7万个模型。会上还有影视、娱乐行业先锋带来跨界视角分享。
除了prompting外,不动参数,如何改变模型行为?
文章指出传统提示工程控制大模型生成行为有缺陷,提出Steering Target Atoms (STA)方法。它用稀疏自编码器分解LLM高维表示,定位“原子知识组件”精准控行为,实验效果超现有技术,还能控制推理长度。
反超Nano Banana!OpenAI旗舰图像生成模型上线
OpenAI发布图像生成模型GPT - Image - 1.5,有更严谨指令遵循、精确编辑等亮点,速度快4倍。玩法类似Nano Banana,在指令遵守和精确编辑上有提升,将在ChatGPT面向所有用户推出,价格下降。但在世界理解能力上遭质疑。
RAG效果不佳?先别急着微调模型,这几个关键节点才是优化重点
文章深入探讨RAG技术实现与优化,指出其在AI应用开发中常被当黑盒,从文档分块、索引增强、编码、混合检索到重排序等关键环节解析,强调结合场景调优以提升召回与精确率。
让扩散模型「可解释」不再降质,开启图片编辑新思路
过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。
Pony Alpha新模型炸场!全球「猜爹大赛」开启
2月7日深夜,OpenRouter悄悄上线匿名模型Pony Alpha,其编程、推理等体验出色,外网瞬间疯传。全球开启‘猜爹大赛’,Claude、DeepSeek、Grok、GLM各派开吵,还凸显了‘匿名盲测式发布’新打法。
“煽风点火”让大模型“卷”起来的提升性能的套路
网友Greg Isenberg分享让AI提升性能的方法,通过利用不同AI模型如ChatGPT、Claude、Grok间的“竞争”,人为制造竞争环境,激发其潜力,可提升输出效果,且方法获很多网友验证认可。