「数学猜想库」共找到 601 篇相关文章
Memento-Skills VS OpenClaw 不改模型也能进化
Memento - Skills让AI Agent自己设计自己,通过部署时学习进化,不动模型参数,将经验写进技能库。经测试,在HLE和GAIA基准测试中准确率大幅提升,与OpenClaw等定位不同,有多种部署方式,不绑定模型。
RAG技巧与底层代码剖析
文章深入剖析 RAG 技巧与底层代码,从用 Python 基础库构建 RAG 系统,到多种优化方法如上下文增强检索、添加上下文块标题等,还涉及查询改写、重排序等技术,最后介绍了上下文压缩、反馈机制等提升系统效率和质量的方法。
员工每天花1000美元也要用ClaudeCode!创始人:太贵了,大公司专属,但它比 Cursor 猛!
Claude Code处理大型代码库能力强,但价格贵,有用户称能力超Cursor。其创始人分享设计理念、使用方法等,还提到它基于Claude 4系列模型有新变化,可在GitHub等场景用,未来会拓展工具协同和小任务处理。
ACM MM 2025 | 小红书AIGC团队提出风格迁移加速算法STD
小红书AIGC团队提出风格迁移加速算法STD。现有一致性模型在风格化任务有缺陷,文章提出从部分噪声状态出发的训练框架STD,设计轨迹状态库减轻计算负担,引入非对称对抗损失增强风格一致性,实验显示其效果优。
哈工大、中科院等利用模型“潜意识”提高推理模型效率,0.6B撬动复杂推理
哈工大、中科院等提出TrajSelector框架,让推理模型‘倾听内心独白’。它利用模型隐藏状态,用0.6B轻量级验证器实现比7B裁判模型更精准选择,在数学竞赛基准测试中表现出色,还能离线筛选数据,但在开放域问答有难题。
大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱
CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。
Reasoning模型可以Self-Train!
当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。
特朗普AI计划在GitHub上泄露,网友怒喷用AI代码“治国”!
距离特朗普政府启动联邦政府AI发展计划不到一月,“AI.gov”项目代码库在GitHub泄露。该项目由GSA与TTS小组开发,计划7月4日上线。此次泄漏引发对公共部门过度用AI的不满,也引发网友对工作中高层盲目推广AI的吐槽。
IMO题库“过时”了!OpenAI内部模型挑战最新First Proof,做了7天错了一半
谷歌发布Gemini 3 Deep Think爆火后,OpenAI用未发布内部模型,一周内尝试解答10道来自数学家科研现场的真实问题,5道基本正确。这些题取自真实研究,切断模型“背答案”可能,意味着自主推理能力进化。
Agent接管EDA工作流,不只写脚本!浙大打通真实芯片设计闭环
大模型正以Agent形态进入真实EDA工具链。浙大卓成团队构建OpenClaw + FluxEDA联合架构,打通关键链路,解决模型操作真实EDA工具的难题,在多任务中完成连续分析与优化闭环,推动EDA工作流范式转变。