GSM8K-V」共找到 1562 篇相关文章

算法论文8

大模型也需要自我反思,上海AI Lab合成“错题本”让大模型数学成绩提升13.3%

上海AI Lab提出LEMMA方法,构建“错误 - 反思 - 修正”数据,让大模型从错误中学习。通过教师模型定向制造“学生会犯的错”构造数据,实验显示在Llama3 - 8B上数学解题准确率提升13.3%。

量子位
新闻资讯7

黄仁勋人生首条推文力挺开源,“Kimi恐慌”成为风暴眼

当地时间7月24日,英伟达创始人黄仁勋发首条推特分享联名信力挺开放权重AI。此事与新开源模型Kimi K3引发的‘Kimi恐慌’相关,‘开源vs闭源’路线之争因此推向高潮。同时,围绕模型蒸馏是否侵权争议不断。

DeepTech深科技
新闻资讯7

Claude还是最强,但Anthropic这周好像疯了

Anthropic状告阿里蒸馏模型致其股价创新低。一位87年创业者用AI搭工作流,起初用DeepSeek和Qwen问题多,换Claude后流程顺畅。MRCR v2测试显示国产模型与Claude有差距,便宜与省心模型该怎么选成问题。

探索AGI
开源动态7

美团也开源了大模型,但我觉得他们的野心是通用生活Agent。

美团发布并开源560B参数的MoE模型LongCat - Flash - Chat,推理速度快。与DeepSeek V3对比,输出速度优势明显。美团多个落地或内测AI功能服务C端生活场景,目标是打造通用生活Agent。

数字生命卡兹克
7

代码里插广告,腾讯 Codebuddy 们 “背锅”?DeepSeek “极你太美”事件,其他模型也逃不掉?

网友发现腾讯 Codebuddy 改写代码时插入广告,字节 Trae 国内版有随机出现“极”字的 bug,根源指向 DeepSeek V3.1。此外,Gemini、Grok、Qwen3 等模型也有类似问题。目前对原因有三种猜测,部分被学者否定。

AI前线
算法论文8

1.5B推理模型新SOTA,RL训练新解法打破「简单题过拟合、难题学不动」的魔咒

QuestA通过在训练中注入解题提示,实现两项成果:在1.5B模型上实现Pass@1的SOTA性能,还提升了Pass@k性能。它解决了RL训练中简单与困难任务的权衡问题,为开发强推理模型打开大门。

机器之心
产品应用7

不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案

作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。

歸藏的AI工具箱
开源动态8

昆仑万维多模态视频生成开源,影音图文全统一

昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。

AIGC开放社区
开源动态8

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元
新闻资讯7

反转!LeCun刚转发「全球最快开源推理模型」,ETH苏黎世就直接打假

上周,MBZUAI与G42等开源号称「全球最快的开源AI推理模型」K2 - Think,引发广泛关注,图灵奖得主Yann LeCun也转发相关推文。但三天后,ETH苏黎世研究员发文指出该模型存在数据污染、评估方式不合理等问题。

新智元