模型应用」共找到 8878 篇相关文章

推荐文章7

什么!我把SQL编辑器装进了大模型

文章介绍基于约束解码技术,结合CFG、Jinja模板和XGrammar框架,为大模型SQL生成配备“编辑器”。它能保证语法正确、遵循规则,还具灵活性。但面临约束干扰和性能瓶颈,未来可简化配置惠及更多用户。

阿里云开发者
算法论文8

除了prompting外,不动参数,如何改变模型行为?

文章指出传统提示工程控制大模型生成行为有缺陷,提出Steering Target Atoms (STA)方法。它用稀疏自编码器分解LLM高维表示,定位“原子知识组件”精准控行为,实验效果超现有技术,还能控制推理长度。

深度学习自然语言处理
推荐文章7

虚拟智库:运用大语言模型获取多元视角

本文探讨如何用大语言模型(LLM)构建虚拟智库。以电商系统架构决策为例,通过让 LLM 扮演不同角色,如 Martin Fowler、David Heinemeier Hansson 等,从多元视角讨论微服务架构利弊,为架构决策提供参考。

InfoQ
新闻资讯7

反超Nano Banana!OpenAI旗舰图像生成模型上线

OpenAI发布图像生成模型GPT - Image - 1.5,有更严谨指令遵循、精确编辑等亮点,速度快4倍。玩法类似Nano Banana,在指令遵守和精确编辑上有提升,将在ChatGPT面向所有用户推出,价格下降。但在世界理解能力上遭质疑。

量子位
推荐文章7

windsurf分享了他们对构建Agent应用的认知。

windsurf发表博客讨论Agent,指出构建Agent应用存在认知误区,分享灵魂四问分析框架评估其‘含金量’,还提到苦涩教训,提醒警惕过度设计,拥抱规模化、通用化方法。

探索AGI
开源动态8

ROLL:面向大规模语言模型的高效强化学习框架

本文介绍阿里推出的ROLL强化学习框架,专为LLM训练优化。它设计灵活,不同用户可用其满足业务、探索或线上指标需求。在多任务训练中性能出色,还采用创新机制提升效率,支持自定义操作,适合学术和业务场景。

阿里云开发者
算法论文8

让扩散模型「可解释」不再降质,开启图片编辑新思路

过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。

机器之心
新闻资讯7

Pony Alpha新模型炸场!全球「猜爹大赛」开启

2月7日深夜,OpenRouter悄悄上线匿名模型Pony Alpha,其编程、推理等体验出色,外网瞬间疯传。全球开启‘猜爹大赛’,Claude、DeepSeek、Grok、GLM各派开吵,还凸显了‘匿名盲测式发布’新打法。

新智元
开源动态8

LeCun的世界模型单GPU就能跑了

LeCun世界模型有新进展,开源极简训练方案LeWorldModel,单GPU就能跑,基于JEPA架构,速度快、参数小、控制强且懂物理,完胜此前JEPA方法,训练更简单。

量子位
推荐文章7

“煽风点火”让大模型“卷”起来的提升性能的套路

网友Greg Isenberg分享让AI提升性能的方法,通过利用不同AI模型如ChatGPT、Claude、Grok间的“竞争”,人为制造竞争环境,激发其潜力,可提升输出效果,且方法获很多网友验证认可。

AI工程化