「动态策略优化」共找到 2252 篇相关文章
模型一个没换,正确率翻了近三倍,这个项目有点东西啊!
GitHub开源项目AutoResearch用同一模型答题,其EvoMap蜂群模式使正确率近三倍于单Agent和常见Sub - Agent模式。它是多Agent评审系统,靠蜂群机制让AI自动科研,还有诸多防幻觉等特点,能用于多场景优化。
LLM应用测试范式的进化
文章指出传统软件测试方法在LLM应用中存局限,探讨将其与AI评估结合应对挑战。抽象出LLM应用三层架构模型,分析传统测试范式适用性,介绍AI安全分析方法,阐述测试挑战、范式转变及协同测试策略。
两个月前的预测成真:千问APP真的打通了阿里生态
近期AI圈动态频出,Google与沃尔玛合作搞AI购物,Anthropic发布Claude Cowork。而阿里千问App更快一步,1月15日成功接入淘宝、闪购等实现AI购物与办事。千问基于阿里生态打通内部,具备强模型与丰富生态优势。
美团开源全模态,比肩顶级闭源模型,开源新SOTA
美团LongCat团队发布5600亿参数开源全模态模型LongCat - Flash - Omni,它有端到端全模态架构,能实现毫秒级实时音频 - 视觉交互。该模型训练采用渐进式策略,工程上有高效技术支撑,在多基准测试表现出色。
世界模型和具身大脑最新突破:90%生成数据,VLA性能暴涨300%|开源
国产世界模型玩家获突破,VLA模型性能涨300%,90%训练数据由世界模型生成。极佳视界开源GigaWorld - 0及训练框架,在多方面优化,经对比性能领先,还验证其生成数据对具身任务的提升作用。
EMNLP2025 | 探究大语言模型的语言共享神经元提升低资源语言能力
论文提出BridgeX - ICL方法提升LLM低资源语言性能,通过三步实现优化。构建两类探测数据解决传统问题,识别重叠神经元,用HSIC选最优桥梁语言,在多任务实验验证其有效,揭示多语言机制规律。
SGLang支持GPT-OSS:从Day 0支持到性能增强
SGLang宣布重大更新,聚焦openai/gpt - oss - 120b模型深度性能优化与新功能。预填充和解码阶段吞吐量显著提升,支持多GPU,有推测解码等功能,还支持智能体应用程序,且不损害模型推理能力。
为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学
上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。
AI 产品定价指南:按量定价的卡点到底是什么?
本文编译 a16z 与 Scott Woody 访谈,探讨 AI 改变软件定价逻辑及企业应对策略,还补充定价专家 Madhavan Ramanujam 关于 AI 产品定价四象限观点,指出按量定价的难点、适用模式及企业转型要点等。
英伟达全新开源模型:三倍吞吐、单卡可跑,还拿下推理SOTA
英伟达推出专为复杂推理和agnet任务打造的开源模型Llama Nemotron Super v1.5,实现SOTA表现,吞吐量提至前代3倍,可单卡高效运行。它采用NAS优化架构,经多数据集训练,现已开源。