数学推理测试」共找到 3521 篇相关文章

开源动态8

社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型

Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。

Hugging Face
算法论文8

Claude团队用Qwen测试全新训练方法

Anthropic最新研究提出中训练(MSM),在预训练后、后训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。

量子位
产品应用7

Codex正在重塑传统推理框架开发流程

作者用Codex完善SGLang Diffusion的SKILLS流程,修复诸多bug。让其做benchmark脚本,发现不同rmsnorm性能差异。应用flashinfer rmsnorm遇问题,Codex找出原因并修复,还提升了模型性能,体现强大生产力。

GiantPandaLLM
7

大模型如何赋能 Web 渗透测试

文章指出传统Web安全检测有局限,而大语言模型(LLM)可提升漏洞发现覆盖率与准确性。以mcp server为基础介绍自动化漏洞检测方案,还分享实践操作、遇到的问题及解决办法,分析其优缺点并给出拓展思路。

阿里云开发者
算法论文8

视觉感知RAG × 多模态推理 × 强化学习 = VRAG-RL

数字化时代视觉信息愈发重要,传统RAG方法处理视觉信息面临挑战。阿里巴巴通义实验室的VRAG - RL将强化学习引入多模态智能体训练,革新检索生成范式,提升视觉语言模型多方面能力,代码已开源。

PaperAgent
产品应用7

Codex在推理框架上能蹬出什么优化

作者复盘用Codex在SGLang中的实践,原本需3 - 4个月的工作量现缩短为1个半月。介绍保证代码质量方法,分享印象深刻的debug经历,列举在SGLang用Codex一个月的优化成果,还提及Claude Code使用遇阻。

GiantPandaLLM
新闻资讯8

88岁图灵奖得主,用Claude一小时破解30年数学悬案

88岁图灵奖得主高德纳发文称,他研究数周、可追溯到30年前的三维图论开放问题,被Claude Opus 4.6仅用1小时、31次探索就破解,还给出通用构造算法,这让向来对生成式AI保留的他致敬Claude。

量子位
新闻资讯7

高通要发两款AI推理芯片,资本市场反应强烈

高通周一宣布明年推AI200芯片,2027年跟进AI250,股价应声上涨。两款芯片基于移动神经处理技术,专攻AI模型部署,沙特AI公司已计划采用,高通想借此进军AI芯片市场。

AI工程化
新闻资讯8

陶哲轩愤怒发文:AI正杀死数学百年开放传统!

本文报道OpenAI被指截胡纽约大学数学家破解纳维-斯托克斯方程的研究成果,菲尔兹奖得主陶哲轩发文怒批,指出AI暴力介入正在摧毁数学界百年开放科学传统,引发学界热议。

新智元
开源动态8

千星项目LLMRouter:多模型路由,16+策略优化推理

UIUC开源智能模型路由框架LLMRouter,可自动为大模型应用选最优模型,有16+路由策略。该框架打通训练、评测等链路,解耦Route与Training模块,支持多轮协同等,还可插件式扩展。

新智元