代码测试」共找到 3136 篇相关文章

新闻资讯8

OpenAI发布新模型硬刚Anthropic!Claude Code刚火,就被GPT-5-Codex拍在沙滩上?

9月15日,OpenAI推出新模型GPT - 5 - Codex,是微调的GPT - 5变体,用于AI辅助编程。它增强了代码审查功能,能动态调整思考时间,在多项基准测试中表现优于GPT - 5,发布后引发网络热议,AI编码工具市场竞争激烈。

AI前线
开源动态8

超越英伟达Describe Anything!中科院 & 字节联合提出「GAR」,为DeepSeek-OCR添砖加瓦

中科院与字节联合提出「GAR」,为构建自然图像的Dense Caption提供新思路。GAR具备精准描述、关系建模和组合推理能力,通过引入新组件,兼顾细粒度与全局上下文,在多测试集表现优异,且代码等已开源。

量子位
开源动态8

300个AI员工,跑满4000步不崩,Kimi新一代模型K2.6来了

月之暗面开源发布 Kimi K2.6 模型,在通用智能体、代码编写和视觉理解等综合能力上全面跃升。它在多项测试成绩领先,能连续工作13小时,还在全栈开发、多智能体协作等方面有出色表现。

AIGC开放社区
推荐文章7

关于现代GPU体系结构内存一致性(Memory Consistency)模型的一些猜想(二)——同步性能

文章聚焦GPU应用层面,通过实验对比不同同步代码实现的性能。在H20 GPU上测试,发现scope越小同步性能越好,内存屏障开销随scope增大而增加,还介绍非PTX及官方推荐实现方式并给出性能对比。

GiantPandaLLM
开源动态8

蚂蚁Ring-1T正式登场,万亿参数思考模型,数学能力对标IMO银牌

10月14日凌晨,蚂蚁万亿级思考模型Ring-1T正式登场,这是全球首个开源的万亿参数思考模型。它在多项基准测试中表现出色,数学能力达IMO银牌水平,还展示了强大的代码、推理、写作等能力,其背后是IcePop算法与ASystem框架的支撑。

机器之心
产品应用7

大厂代码库几百万行,Claude Code怎么跑起来的?Anthropic首次公开全套打法

Anthropic发布文章总结Claude Code在企业规模部署的最佳实践。Claude Code导航类似软件工程师,与RAG驱动工具不同。其harness由多扩展点组成,在部署中有三种常见配置模式,还给出应用建议。

AI寒武纪
开源动态7

Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。

InfoQ
算法论文8

BIGAI & 中科大团队提出 MILR: 测试时隐空间推理,让图像生成学会「边想边改」丨ICLR 2026

BIGAI与中科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化图文表示,提升复杂图像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。

AI科技评论
新闻资讯7

cursor翻车了,Anthropic:来,我教你怎么做long running Agent。

近期,Cursor宣称用大量智能体实现长程任务引发关注,但被指是营销惨案,代码存在诸多问题。Anthropic则分享务实的long - running思路,是记忆接力模式,代码可维护。未来模型能力提升或让代码成黑箱。

探索AGI
新闻资讯8

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子

ARC Prize官方给Opus 5的ARC - AGI - 3成绩为30.2%,但开发者Jeremy Berman让其借助电脑,正确率飙升至96.2%。还开源代码,换用Codex等测试效果差。表明模型强时,简单环境更佳。

新智元