自动化数学证明」共找到 1067 篇相关文章

开源动态8

19K star 霸榜,下一代的浏览器自动化神器!

做爬虫或Web自动化测试常因网页结构变动需重写脚本。Github上超火的Skyvern项目是基于浏览器的自动化代理,不依赖XPath或CSS选择器,用视觉识别结合大模型推理完成任务,已获19k+ star。

开源先锋
算法论文8

强化学习新发现:无需数学样本,仅游戏训练AI推理大增

莱斯大学、约翰斯・霍普金斯大学和英伟达研究团队有颠覆性发现,让多模态大语言模型玩简单游戏,无需数学样本,就能显著提升其多模态推理能力。提出的ViGaL方法在多个基准测试中表现出色。

机器之心
推荐文章8

评测也很酷,Data Agent 自动化评测的三层框架与实战

在大模型技术飞速发展下,评估应用效果成难题。字节跳动尹小明分享自动化评测技术,提出三层评测框架,还介绍 Text - to - SQL 及深度研究评测改进,以及评估平台建设,最后展望自动化评测未来方向。

AI前线
算法论文8

RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈

大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。

深度学习自然语言处理
8

开源AI浏览器自动化框架!14.3K+ Star,自然语言+代码,爬虫效率翻倍!

传统浏览器自动化工具维护成本高,全AI代理缺乏可控性。Stagehand是Browserbase开发的开源AI浏览器自动化框架,结合自然语言和代码控制,有多种核心功能,获14.3K+ GitHub Star。

开源星探
新闻资讯8

一周两破18年数学纪录!陶哲轩惊叹:AlphaEvolve带来久违「加速度」

人类数学家与AlphaEvolve携手,一周内两次刷新18年未破的数学纪录。先是AlphaEvolve将和差集的θ下界提升,后人类数学家Gerbicz在其基础上再进一步,展现AI与人类协作在数学研究中的惊人潜力。

新智元
算法论文8

美团LongCat扎扎实实做了件难事:LLM数学新天花板AMO-Bench

美团LongCat团队联合高校推出AMO - Bench,用50道原创奥赛级难题评估LLM数学能力。它解决现有基准测试痛点,经四重把关构建,测试显示顶级模型表现不佳,也揭示模型提升空间大。

PaperAgent
开源动态8

告别 Selenium 痛点!全新升级版 Selenium 自动化框架,斩获10.2K标星!

Selenium 编写 Web 自动化脚本痛点多,SeleniumBase 深度封装 Selenium,内置智能等待等功能,解决诸多问题。它功能强大,安装使用简单,适用于多场景,像“智能助手”让自动化测试变简单。

开源星探
新闻资讯8

OpenAI新模型让数学家集体破防?一场关于数学未来的精神危机

OpenAI下一代主要模型Astra内部版本在多数学领域给出十项新研究结果,让数学界震动。数学家看法不一,有人惊叹,有人迷茫,还有文章指出这或引发数学学科意义的精神危机。

机器之心
算法论文7

拆解大模型几项核心操作背后的数学与 Infra 优化逻辑

文章拆解大模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。

腾讯技术工程