「代码生成基准」共找到 4237 篇相关文章
最强开源搜索再升级,研究、预测能力实测超惊艳!
MiroMind团队发布新一代模型MiroThinker-1.7和MiroThinker-H1,定位为重型推理智能体。其研究能力强、推理可靠,还能生成网页报告。新版本升级显著,靠两项关键技术实现有效交互,且预测案例表现出色。
以「图」破局,HyperOffload定义超节点存储管理新范式
随着生成式AI进入万亿参数时代,大语言模型面临“显存墙”挑战。上海交大与华为MindSpore团队发布技术报告《HyperOffload》,其核心技术集成于MindSpore 2.8,能提升超节点异构资源协同效率,已在多项目落地。
多稿合并:从手动比稿到一键 Skill
AI 翻译或写作常生成多版本稿件,各有亮点但不完美。手动合并耗力,可让 AI 完成。还能将流程做成 Claude 的 Skill,介绍了两种创建方式及适用场景,给出多稿合并 Skill 示例。
刚刚,Claude独立攻克图论猜想,仅用31步!算法祖师爷高德纳震惊发文
Claude Opus 4.6仅用31步独立攻克图论猜想,算法祖师爷高德纳震惊发文,认为需重新评估生成式AI在数学研究中的作用。这标志着AI在自动推理和解决创造性问题上达到新里程碑。
姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:人类仅剩7人捍卫碳基编程
面对Claude Opus 4.6和GPT Codex 5.3的攻势,谷歌升级Gemini 3 Deep Think,在多项基准测试刷爆SOTA,推理成本降低82%。它还走进科研工程领域,其研发团队有不少华人,如姚顺宇、Yi Tay。
刚刚Gemini上新模型,全球只有7人比它会编程,谷歌姚顺宇参与
北京时间周五凌晨,谷歌发布Gemini 3 Deep Think重大升级,在多学术基准测试中取得佳绩,成本大幅降低,编程能力超多数人。在多科学领域表现出色,还推动了实际应用,已上线供部分用户使用。
AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华
随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。
用AI深读100本书,太上头了~
国外开发者Pieter让Claude深读100本非虚构类书籍,用AI‘深化’阅读。AI能在书间找联系,还生成奇葩分类并挖出洞见。实验带来三个启发,还给出低成本复制思路,强调学习要让知识建立连接。
Clawdbot爆火背后的9个真相:创始人首次公开访谈全揭秘
Clawdbot(现名Moltbot)爆火,GitHub星数激增。其创始人Peter Steinberger首次公开访谈揭秘9个真相,包括项目原型1小时完成、被AI语音回复震惊、被强制改名等,还分享对融资、安全及行业趋势的看法。
Gemini准确率从21%飙到97%!谷歌只用了这一招:复制粘贴
Google Research研究发现,将输入问题复制粘贴一遍,能让大模型在非推理任务上准确率惊人提升,如Gemini 2.0 Flash - Lite从21.33%升至97.33%,且几乎不影响生成速度,但不适用于推理场景。