「低熵模型」共找到 8134 篇相关文章
实测Kimi全新Agent模型「OK Computer」,很OK
Kimi发布全新Agent模型「OK Computer」,依托Kimi K2,能搭网站、做PPT、处理大量数据。实测显示它在设计、生成、分析类任务表现不错,设计无需找素材,分析无需想角度,生成还能推荐风格。
什么!我把SQL编辑器装进了大模型?
文章介绍基于约束解码技术,结合CFG、Jinja模板和XGrammar框架,为大模型SQL生成配备“编辑器”。它能保证语法正确、遵循规则,还具灵活性。但面临约束干扰和性能瓶颈,未来可简化配置惠及更多用户。
魔搭社区想做的,不只是模型平台
首届魔搭开发者大会在北京举行。魔搭社区发起人周靖人发布开发者勋章激励计划,是对「MaaS」理念的延展升级。魔搭已汇聚超500家机构,发布超7万个模型。会上还有影视、娱乐行业先锋带来跨界视角分享。
除了prompting外,不动参数,如何改变模型行为?
文章指出传统提示工程控制大模型生成行为有缺陷,提出Steering Target Atoms (STA)方法。它用稀疏自编码器分解LLM高维表示,定位“原子知识组件”精准控行为,实验效果超现有技术,还能控制推理长度。
Gartner发布生成式AI模型提供商魔力象限
Gartner发布《生成式AI模型提供商创新指南》,首次对生成式AI市场进行象限划分,按功能完整性和未来潜力将厂商分为新兴领导者、新兴挑战者、新兴远见者和新兴专家四个区域,还指出AI正从实验转向企业核心层。
反超Nano Banana!OpenAI旗舰图像生成模型上线
OpenAI发布图像生成模型GPT - Image - 1.5,有更严谨指令遵循、精确编辑等亮点,速度快4倍。玩法类似Nano Banana,在指令遵守和精确编辑上有提升,将在ChatGPT面向所有用户推出,价格下降。但在世界理解能力上遭质疑。
让扩散模型「可解释」不再降质,开启图片编辑新思路
过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。
Pony Alpha新模型炸场!全球「猜爹大赛」开启
2月7日深夜,OpenRouter悄悄上线匿名模型Pony Alpha,其编程、推理等体验出色,外网瞬间疯传。全球开启‘猜爹大赛’,Claude、DeepSeek、Grok、GLM各派开吵,还凸显了‘匿名盲测式发布’新打法。
LeCun的世界模型单GPU就能跑了
LeCun世界模型有新进展,开源极简训练方案LeWorldModel,单GPU就能跑,基于JEPA架构,速度快、参数小、控制强且懂物理,完胜此前JEPA方法,训练更简单。
首个基于 MCP 架构的低代码 RAG 框架
检索增强生成系统复杂度提升,科研人员面临高昂工程成本。清华大学等联合推出 UltraRAG 2.0,基于 MCP 架构,降低复杂 RAG 系统技术门槛与学习成本,支持低代码构建复杂系统。