「Coding 基准测试」共找到 2878 篇相关文章
Redis之父:手写代码?醒醒吧除非你图一乐
Redis之父Antirez在博文指出,编程已被AI永远改变,手工写码不再明智。他用实测案例展示Claude Code强大效率,警告程序员别喝‘反AI迷魂汤’,应重构工作流拥抱AI。
全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%
斯坦福和MIT团队推出新AI智能体推理框架ReCAP,在长上下文任务中全面超越ReAct,性能提升显著。它通过独特结构和三大机制解决大模型常见问题,虽成本增加,但在关键任务表现出色,潜力巨大。
比思维链准43%!逻辑脑+大模型直觉,推理可靠性大幅提升
中德研究团队发布成果,给大模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。
登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini
加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型。
邱锡鹏老师团队发布VehicleWorld:让智能汽车真“智能”
邱锡鹏老师团队发布论文,构建高度仿真的智能座舱虚拟环境VehicleWorld,并提出基于状态的函数调用(SFC)方法。实验显示,SFC大幅提升任务执行准确率和效率,还构建了Vehicle Benchmark进行评估。
LeCun出手,造出视频世界模型,挑战英伟达COSMOS
训练有效世界模型面临数据、任务难度、算力消耗和评估等难题。Meta研究者提出通用视频世界模型DINO - world,可预测未来帧,在多方面有优势,实验显示其性能显著,能降低对标注数据需求。
Meta开源Muse Glimmer,30B Agent小钢炮跑进你的电脑
Meta发布并以宽松协议开源Agent模型Muse Glimmer。它30B参数,能跑在Mac或PC上,多项Agent基准领先。可完成端到端任务、调用工具及多步推理,接受文本与图像交错输入,用途广泛。
双榜SOTA!微软ACL2026新作重新定义AI长记忆
大语言模型落地中,AI长期记忆能力成瓶颈,传统RAG方案有局限。微软研究团队提出AI记忆框架Mnemis,受认识论与认知科学启发,在两大权威长期记忆基准达SOTA性能,工作被ACL2026主会议接收。
两个浙大学生决定只用AI生存72小时|甲子光年
五源资本发起“72小时AI生存挑战”,浙大学生区瀚楠、陈睿轩参与。他们在封闭房间用AI工具生存72小时,先搭建Agent购得物资,后尝试用AI赚钱未成功。此活动灵感源于99年“72小时网络生存测试”。
Karpathy:写了20年代码,现在像作弊
Karpathy曾造词“vibe coding”,一年后弃用。他开源autoresearch项目,让AI Agent自主跑实验,自己不写代码。他还展示家庭监控分析系统也由Agent完成。他提出“agentic engineering”,认为工具虽变,但深度技术专长更重要。