动态上下文发现」共找到 1985 篇相关文章

算法论文8

传统RAG只会翻书不会用?RAG+让Reasoning能力上一个新高度!

现有检索增强生成(RAG)技术在需复杂推理领域表现不佳,像只给菜谱不给实操演示。RAG+开创性新增“应用案例库”,与知识库构成双料库,在数学、法律、医疗场景测试中全面碾压传统方案,团队还透露了未来方向。

深度学习自然语言处理
新闻资讯7

数学圈地震!o3靠直觉刷爆人类顶尖难题,14位专家集体破防

Epoch AI新研究发现,o3 - mini - high能破解顶尖数学难题,具备渊博学识且会基于直觉解题,但推理风格依赖直觉,缺乏严谨性和创造力,还存在投机取巧、幻觉等问题。

新智元
算法论文7

多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品

现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。

量子位
开源动态8

错过它=落伍!只用一张照片+14秒,腾讯开源 HunyuanVideo-Avatar 带你玩转多角色数字人

HunyuanVideo-Avatar 是腾讯混元团队最新开放的多模态数字人生成模型。上传一张人物图片,再配上一段音频,模型即可在约 14 秒内输出分辨率最高 720p、情绪可控、动作丰富且支持多角色同屏的短视频。

小华同学ai
产品应用7

为什么Cline不对你的代码库进行索引(以及为什么这是好事)

用户常问Cline如何处理大型代码库,是否用RAG索引全部代码。Cline特意选择不对代码库进行索引,因为传统RAG方法用于代码库有逻辑切割、索引过时、安全风险等问题。Cline像开发者一样处理代码,有独特优势。

宝玉AI
新闻资讯7

57.6万代码撕碎AI编程神话,20%「幽灵包」暗藏漏洞!苹果、微软已中招

最新研究用57.6万个代码样本揭示,超20%代码依赖的是不存在的软件包,为供应链攻击创造机会。Meta和微软虽看好AI写代码,但AI生成代码或成安全灾难,开发者需仔细检查。

新智元
算法论文7

DeepSeek们越来越聪明,却也越来越不听话了。

论文《When Thinking Fails: The Pitfalls of Reasoning for Instruction - Following in LLMs》用实验验证,模型推理能力变强时,提示词遵循能力变差。研究团队对15个模型测试,发现用CoT推理后执行准确率下降,还提出4种提升指令遵循效果的方案。

数字生命卡兹克
开源动态8

AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺

ASI-Bench是衡量AI系统科学自主性的基准测试,由多机构联合开发。它能测试AI通用智能、创新性和执行力,通过信息梯度设计,让模型在不同指导量下完成科研任务,结果显示当前AI离自主科研有明显距离。

机器之心
新闻资讯7

刚刚,Claude两个新模型曝光!

开发者在Anthropic的API中发现Claude的两个新模型代号claude - marshmallow - eap和claude - melon - eap,目前处于内部测试阶段。社区有多种推测,且Anthropic命名风格改变,新模型或下月发布。

机器之心
推荐文章8

翁荔新博客提出「自进化先从Harness开始」,DeepSeek崔添翼转发附议

前OpenAI安全副总裁翁荔新博客探讨AI自进化,提出从Harness开始的现实路径。DeepSeek崔添翼转发附议,认为Harness方向自进化很可能出成果。翁荔梳理研究,展示优化递进趋势,也指出实现递归自我改进存在的瓶颈。

量子位