「数学问题」共找到 3423 篇相关文章
UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力
大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。
浙大开源HugAgentOS:三引擎一体自进化,每步可归因/回放/回滚
过去一年,Agent任务执行能力提升,但不会自主积累与进化。浙大开源的HugAgentOS把Harness拆成三个可自我成长的引擎,设归因和本体两道关卡,解决经验成能力等问题,还覆盖智能体完整链路。
6.2K Star!25 种风格配方让 AI 前端审美直接拉满!garden-skills把这事做彻底了。
AI 站点界面同质化严重,开发者陷入享受便利又抱怨产出同质化的矛盾。开源项目 garden - skills 由 ConardLi 开发,是面向 AI 编程代理的技能集合,解决了界面审美和流程不稳定问题,有多种亮点与安装方式。
Claude Code太难?Coze帮你3分钟做出可变现的 Skills
Claude Code和AI Skills很火,但靠其变现困难,如安装调试复杂、不知如何推广等。Coze 2.0更新解决了这些问题,还提供长期计划能力和新年福利,可让用户无需工程能力参与AI生态价值分配。
程序员下班一看懵了?白嫖 Gemini / 本地大模型做时间追踪,用这个开源小工具给你一天自动出「git log」
Dayflow 是原生 macOS 开源应用,能以 1 FPS 录屏,用 AI 总结生成时间线,解决传统时间追踪记录不具体问题。它功能丰富,有自动时间线、分心高亮等,还支持多种 AI 模式,数据隐私性好。
Thinking Machines 发布又一神作「在线策略蒸馏」 ,LLM后训练效率飙升50-100倍
Mira的THINKING MACHINES开源「在线策略蒸馏」LLM后训练方法,结合两种主流后训练范式优点,提升训练效率50 - 100倍,成本降低9到30倍,可用于数学推理、模型个性化等场景。
VAE时代终结?谢赛宁团队「RAE」登场,表征自编码器或成DiT训练新基石
纽约大学谢赛宁团队推出RAE替代VAE,解决了DiT依赖旧版SD - VAE的问题,如架构复杂、潜空间受限等。RAE结合预训练编码器和解码器,还提出DiT^DH变体,实验效果好,网友看好其前景。
Karpathy再放大招:8000行代码复现ChatGPT全栈,最低成本仅100美元,4小时跑完
Andrej Karpathy发布项目nanochat,是全栈式ChatGPT克隆体训练/推理流水线,代码约8000行,覆盖训练分词器、预训练等完整流程。介绍不同成本下模型表现,还回答网友关于架构、训练数据等问题。
大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO
本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。
马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?
Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。