「风险度量优化」共找到 1707 篇相关文章
刚刚,OpenAI 发布 GPT‑5-Codex 新模型,专为编程而生
OpenAI 发布专为 Agent 编程优化的 GPT-5-Codex 新模型,在动态思考、性能、代码审查等方面表现出色。同时,Codex 平台大升级,集成 GitHub,保障安全隐私,还公布了定价与可用性。
提速30倍,Meta重新定义了新一代RAG!
LLM时代,RAG成知识密集型任务标准范式,但处理长上下文时面临延迟高、内存贵问题。Meta超级智能Lab针对RAG特殊结构优化,提出REFRAG框架,有独特训练策略,实验效果显著。
从第一性原理出发的RAG推理新范式来了,蚂蚁DIVER登顶权威基准
当前RAG系统处理多步逻辑推理任务有局限,蚂蚁集团团队提出DIVER框架解决推理密集型检索难题。它将检索任务分四阶段,在BRIGHT榜单领先,行业对比优势明显,医疗应用效果好。
挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因
随着大语言模型发展,多智能体系统潜力大但失败率高。新加坡国立大学等机构研究者提出AgenTracer框架,构建标注管线、设计轻量级追踪器,在失败归因任务上超大型闭源模型,还能助力系统自我提升。
Python 2还能走多远?
自2020年Python 2停止维护,虽仍有项目在用,但企业和社区都在向Python 3迈进。文章介绍了Python 2的发展历程、存在的问题,阐述Python 3的优势,并给出了从Python 2切换到Python 3的方法。
EMNLP2025 | LLM多次回答一致就一定正确吗?非也
随着LLMs在高风险领域广泛应用,其输出的事实性错误引发安全质疑。中科院计算所和美团团队论文揭示自我一致错误,传统检测方法对此失效,提出跨模型探针法提升检测能力。
只因太信ChatGPT,60岁男子三个月后险进精神病院...
美国《内科医学年鉴》刊登真实病例,60岁男子听ChatGPT建议用溴化钠代替食盐养生,致溴中毒,身心失控。医生实验发现ChatGPT回复缺健康警告,今年已有12起因信ChatGPT住院案例。
大模型如何推理?斯坦福CS25重要一课,DeepMind首席科学家主讲
Google DeepMind首席科学家Denny Zhou在斯坦福CS25课程分享大语言模型推理见解,总结了四个关键点,阐述推理机制、优化方法及最新进展,还介绍多种推理方法并比较其优劣。
马斯克痛失xAI大将!Grok 4缔造者突然离职,长文曝最燃创业内幕
xAI联创Igor Babuschkin官宣离职创业,他回顾在xAI两年,团队120天打造超算Colossus,训出Grok 4。他将创办风险投资公司,马斯克致谢,其离职让xAI未来发布少关键一员。
纽约客:人工智能热潮,正在演变为一场泡沫吗?
科技巨头股价攀升、惊人 IPO 重现,让人想起互联网泡沫时代。作者探讨人工智能热潮是否会演变为泡沫,分析了当前与九十年代的异同,指出虽有泡沫迹象,但也存在差异,一切仍不确定。