「编程竞赛基准」共找到 2040 篇相关文章
DeepSeek-V4-Flash正式版发布并开源,全面超越V4-Pro预览版
DeepSeek-V4-Flash正式版发布并开源,这一304B轻量级模型经后训练,性能远超V4-Pro预览版,与Claude Opus-4.8接近。模型权重开源后上Huggingface趋势榜第二,性价比高,实测表现佳。
我去,程序员的福音啊?2.69 万 Star Maple Mono,真心不错,我已经用上啦~~~
介绍开源编程字体 Maple Mono,它将圆角、连字等多种特性融入一套字体,能提升代码可读性、优化符号表达等,解决了程序员高频痛点,但也有局限性,建议试用。
Nathan Lambert:GLM-5.2是开源Agent重大突破,连锁反应将渗透进更广泛的经济体
开源AI观察者Nathan Lambert称GLM - 5.2能做顶尖付费AI才能做的事,是开源Agent重大突破。其表现超预期,是首个在编程框架中用着‘手感极佳’的开放权重模型,将给闭源模型带来价格压力。
小模型代替顶级闭源:微软用4B小助理,砍掉30% Token消耗
微软研究团队提出实用方案,用4B参数的微型模型Terminus - 4B替换昂贵顶配大模型接管终端执行任务,采用SFT和RL策略打造子智能体,经测试效果良好,节省Token消耗。
VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破
当前VLA模型常依赖视觉线索而非语言指令,导致新场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化能力,还保留语言核心功能。
TACO: 让 CLI Agent 在自主迭代中学会丢掉无用上下文
由多校及研究团队联合提出 TACO,这是无需训练、即插即用的终端智能体自进化观测压缩框架。它能让智能体学习压缩规则,过滤低价值输出,保留关键线索,实验显示其提升了任务成功率和 token 效率。
图像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力
上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析图像编辑模型视觉推理能力。研究发现模型零样本表现弱,扩散式模型更适合视觉规划,CoT效果不稳定等。
“龙虾之父”接连点赞,星标 5k+:有道龙虾李良才拆解全场景 Agent 演进逻辑与 Vibe Coding 实战
网易有道推出国内大厂首个 100% 开源 Agent 产品有道龙虾 (LobsterAI),发布不到一月在 GitHub 获 4000+ Star,还获‘龙虾之父’点赞。有道 AI 应用架构师李良才在大会分享其养成史、架构选型及 Vibe Coding 实战。
新鲜出炉!Claude Code之父亲授 Opus 4.7 最佳实践
Anthropic发布的Opus 4.7被定位为最强模型,Claude Code创始人Boris Cherny分享使用最佳实践,介绍4.7与4.6区别、构建交互编程会话方法、effort等级设置等内容。
OpenAI突然封锁最强GPT-5.4!3000个致命Bug瞬间蒸发
OpenAI在Claude Mythos泄露一周后,祭出专门为安全防御微调的GPT-5.4-Cyber,仅网络安全专家可用。还升级网络安全“信赖访问计划”。其战略有三原则,Codex Security已修好超3000个高危和致命漏洞。