数学推理测试」共找到 3512 篇相关文章

新闻资讯7

o3崛起,但推理模型离「撞墙」只剩一年?

OpenAI的o3推理模型诞生不到一年能力突飞猛进,算力暴增10倍。但Epoch AI等警告,最多一年推理模型或撞上算力资源极限。还从其他模型和业内人士看法分析推理算力,指出算力与性能有关联,也有发展瓶颈。

新智元
开源动态7

给Kali 加个MCP,直接用cursor做渗透测试

文章围绕用MCP调用Kali进行渗透测试展开,介绍国外大神实现此方法并开源。阐述系统原理、Cursor配置,通过实际测试展示效果,指出MCP让渗透测试调用更简洁,是较大进步,还给出了代码链接。

AI与安全
推荐文章7

一篇综述:知识图谱的3种类型,6大推理任务

知识图谱(KGs)在认知智能系统中作用关键,知识图谱推理(KGR)能基于现有事实推断新知识。文章综述了3种知识图谱类型、6大推理任务,介绍推理方法、应用,还指出KGR面临的挑战与机遇。

CourseAI
新闻资讯7

什么都不做就能得分?智能体基准测试出现大问题

随着AI智能体走向实际应用,其基准测试变得至关重要。但现有基准测试问题多,如WebArena判错答案、τ - bench给无操作智能体高正确率。文章提出有效性判据和ABC清单,还揭示主流基准测试诸多问题。

机器之心
开源动态8

深度拆解,硬核解构,揭开vLLM推理系统实现高效吞吐的秘籍

文章深度拆解 vLLM 推理系统,介绍其核心组件和高级特性,包括推理引擎流程、调度机制、高级功能等,还提及系统扩展、分布式部署、性能测量等内容,助力读者理解推理引擎工作原理。

机器之心
新闻资讯7

大模型可否胸有成竹?探索LLM推理与自信心的关系 | 直播预约

本次全英文直播将探讨大语言模型推理能力扩展瓶颈,介绍以置信度为核心的推理视角,展示“自确定性”指标及应用,还会讨论方法有效性和“基于置信度的推理”意义。

深度学习自然语言处理
算法论文8

压缩即是全部 —— 菲尔兹奖得主给数学和 AI 的一封信

2026年3月,菲尔兹奖得主Michael Freedman发表论文《Compression is all you need》,用代数模型回答人类构建数学、人类与形式数学区别、人类数学家与AI协作三个问题,答案是“压缩”。文章还探讨了压缩在多领域的体现及对AI的意义。

力学与人工智能
新闻资讯8

陶哲轩经费被断供,在线发帖自证数学有用

菲尔兹奖得主陶哲轩就职的UCLA科研经费被冻结,个人研究及应用数学研究所IPAM失去资金支持,还遭网友质疑其学术成果价值。他开新帖以“压缩感知”研究为例,力证数学研究回报,并将视野扩展到AI大模型。

量子位
算法论文8

告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式

现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。

机器之心
产品应用7

从人工到AI驱动:天猫测试全流程自动化变革实践

AI时代,天猫技术质量同学探索AI在测试全流程提效的落地方案,将传统测试工作链拆解为五阶段,目标是实现全流程自动化等。介绍了测试体系变革、所需关键能力、技术架构及落地收获与未来趋势。

阿里云开发者