「编程竞赛基准」共找到 2039 篇相关文章
感觉这次扣子 2.0 触碰了模型和工程的天花板
2026 年,真正好用的 AI Agent 应能拆解目标、推进过程和交付验收。扣子 2.0 正式发布,从“给指令的工具”变为“能干活的工作伙伴”,有技能和长期计划两大核心升级,还具备扣子编程功能,拓宽了 AI 能力边界。
对标GPT-4o和香蕉!浙大开源ContextGen:布局身份协同新SOTA
浙江大学ReLER团队开源ContextGen框架,攻克多实例图像生成中布局与身份协同控制难题。基于Diffusion Transformer架构,用双重注意力机制实现布局精准锚定与身份高保真隔离,在基准测试中超越开源SOTA模型,对标GPT - 4o等闭源系统。
500万视频数据集+全新评测框架!北大开源主体一致性视频生成领域新基建OpenS2V-Nexus,生成视频 「像」 又 「自然」
北大团队推出开源套件OpenS2V - Nexus,含全球首个S2V细粒度评测基准OpenS2V - Eval和500万条高质量人物文本视频三元组数据集OpenS2V - 5M,还评测18个S2V模型,揭示主流模型能力差距。
把20多种工具塞进一个搜索框!亲测「Agentic Search」后,我关掉了几十个浏览器标签页
秘塔AI推出Agentic Search,是“边想边搜,边搜边做”新搜索方式,能自主完成多步工具调用。作者测试其为AI笔记应用策划预热活动等场景,还测市场分析、编程学习、新媒体运营场景,虽有不足但未来可期。
字节押注AI Coding:百万月活的TRAE,如何改写开发者生态?|甲子光年
字节跳动在火山引擎Force 2025原动力大会主推自研AI编程产品TRAE,其月活超百万,内部80%工程师在用。AI Coding能提升大模型能力,助字节逼近AGI。TRAE更新功能,未来或成独立开发超级个体。
云计算“活教科书”语出惊人,指明程序员的进化方向
亚马逊云科技副总裁Jeff Barr被称云计算“活教科书”。他认为AI编程工具放大开发者技能,开发者应提升沟通能力,未来“短命应用”将涌现,云与AI结合是趋势,还见证了中国云计算发展的巨大进步。
OpenAI深夜祭出GPT-5,所有人能免费用!Altman:像和博士级专家对话
北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推GPT - 5 - mini和GPT - 5 - nano两款新模型,免费用户可使用部分版本。它在编程和健康领域测试表现出色,引发各界热议。
The Information:揭秘 OpenAI GPT-5 崎岖的研发之路
The Information揭秘OpenAI GPT - 5研发困境,今年OpenAI遇技术难题,o3等模型研发受阻,内部有分歧。不过GPT - 5在编程等方面有提升,虽难与早期飞跃相比,但改进仍有价值,公司还在开发‘通用验证器’。
社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型
Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。
MSRA首测AI从零建仓库:能写、能跑,但不一定对丨ACL'26
微软亚洲研究院工作RepoGenesis被ACL 2026高分录用,它是面向多语言、仓库级、端到端Web微服务生成的基准。输入贴近实际,用多维度评测开源Agent和商业IDE,还拓展模型微调。但也有边界,未模拟真实复杂需求。