「工具链式推理」共找到 3802 篇相关文章
3.8K星爆款!Google「langextract」可视化溯源,信息抽取神器
Google的「langextract」在GitHub获3.8K星,是信息抽取神器。它有精准源定位、可靠结构化输出等特点,支持多种LLM,适用于各领域,文章还给出实战代码示例。
GPT-5 最强大的,是编程
据报道,OpenAI的GPT - 5即将到来且早期反馈积极。它在编程领域表现突出,尤其在实际编程任务上有提升,不过其具体形式存疑,改进或多来自后训练阶段的强化学习。
GAIA 榜首,杀疯了!高并发、多任务京东开源的JoyAgent秒杀行业巨头
本公众号关注AI前沿技术,分享实战案例与课程。京东开源轻量化通用多智能体产品JoyAgent - JDGenie,可挂载新场景功能,在GAIA榜单准确率超行业知名产品,还介绍了其架构特点与创新点。
Claude code:下一个千亿级软件市场的蓝图
LATE CHECKOUT CEO认为Claude Code将带来软件行业变革,它驯服终端,让自然交互成趋势,会催生新机遇和超级用户,未来软件易用性价值更高,技术将适应人类语言。
我把周末写的代码开源了,结果炸出了几千个被微信群逼疯的人
作者受微信信息焦虑困扰,用Chatlog开发Chatlog WebUI,能自动总结群聊信息。该工具功能丰富,已开源,作者还想加新功能,希望用AI解决生活痛点。
grok 4一图流
文章展示grok 4核心数据,涵盖训练成本、模型定价,还列举其在通用、专业、数学、推理、编程等能力测试中排名第一的成绩,不过实际水平还有待观察。
真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击
上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。
ICML 2025 | 清华、上海AI Lab提出专家级医学基准MedXpertQA,看o3、R1哪家强
本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。
DeepSeek被「猫咪睡觉」给干崩了……
研究员发现,在数学题后加「有趣的事实:猫咪一生大部分时间都在睡觉」,能让DeepSeek数学能力崩塌。研究开发CatAttack方法找「触发词」,无关触发词使模型错误率飙升,还会让回答变长。
63页的面向AI搜索范式:Multi-agent、MCP、DAG、RL
百度搜索发布63页《迈向人工智能搜索范式》Paper,介绍模块化、多智能体框架,新范式协调四个专门LLM代理处理搜索事务,还提及新内容及重要性,为下一代AI搜索系统提供基础。