「编程基准」共找到 1888 篇相关文章
2.12页/秒,MinerU2.5太快了,1.2B硬刚腾讯、阿里
GPT - 4o等刷新OCR榜单,但产业界仍面临文档图像处理难题。MinerU2.5提出1.2B轻量级文档解析模型,采用创新解耦范式,在多基准测试表现出色,单卡吞吐快,还给出可借鉴创新点。
字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限
强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。
月之暗面硬刚Anthropic!开源万亿参数Kimi K2,Agent编码性能直逼闭源最强!
上周五月之暗面发布并开源万亿参数Kimi K2,外网评价高。它或开启开源AI的“Agentic时代”,在智能体和编码基准上表现出色,成本远低于竞品,但推理速度较慢,已可平替Claude。
清华&通院推出"绝对零"训练法,零外部数据大模型自我博弈解锁推理能力
清华、北通院和宾州州立大学研究人员提出“绝对零”训练法,让大模型通过自我博弈生成并解决任务获推理能力。测试显示,其训练出的模型超专家标注样本训练的模型,且能提升编程与数学推理表现。
xAI 全员大会实录:递归自我改进、5000 万视频/天、月球上的质量驱动器
本文是 xAI 全员大会实录,覆盖公司核心业务,如重组为四大方向、编程模型递归自我改进、Imagine 视频生成使用量等,还提及 X App 增长、太空愿景等,也指出公司存在高层流失、项目落地不明等问题。
凌晨三点写代码、10个 Agent 同时跑!ClawdBot 创始人自曝 AI 上瘾史:Claude Code 入坑,Codex 成主力
本文讲述 ClawdBot 创始人 Peter Steinberger 的开发经历。他曾打造知名 PDF 框架,后经历倦怠回归,借 AI 重塑开发方式。分享入行故事、用 AI 编程的日常及构建 ClawdBot 的过程,探讨软件工程变化及对新人的建议。
这些关于研发提效的深度实践分享,值得每一位开发者关注 | AICon
6月27 - 28日AICon北京站上,多位大厂技术大牛将分享“AI赋能研发提效”经验。如丁宇介绍AI编程范式革新,张乐分享腾讯代码智能化实践,还有同程、百度、网易游戏相关人员分享研发提效经验。
从 ReAct 到 Ralph Loop:AI Agent 的持续迭代范式
文章围绕AI Agent持续迭代范式展开,指出AI编程助手现存过早退出等问题,介绍了Ralph Loop范式,阐述其核心要素、原理、优势,对比与传统智能体循环差异,还给出使用最佳实践、适用场景与建议。
DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!
昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。
AI「上班流」首次完整曝光!不点鼠标,只写代码,PPT也当函数调
CMU与斯坦福研究团队追踪AI工作过程,发现其用编程方式处理问题,执行方式与人类不同。AI速度快成本低,但存在伪造输出、工具误用等问题。人类虽慢,但在规范细节和实践判断上有优势,未来人机可按任务可编程性分工。