编程测试」共找到 2635 篇相关文章

新闻资讯7

LLM总是把简单任务复杂化,Karpathy无语:有些任务无需那么多思考

随着推理大模型和思维链普及,大模型有了‘深度思考’能力,但现在有些偏科,简单任务也复杂化。AI大牛Andrej Karpathy发长文指出该现象,认为是基准测试优化所致,大模型发展不能只追求分数。

机器之心
新闻资讯8

重磅!OpenAI深夜发布ChatGPT Agent:AI打工人正式上线「附发布会全程视频」

OpenAI推出ChatGPT Agent,它整合Operator远程浏览器和Deep Research能力,Pro、Plus和Team用户可激活。能完成复杂任务,有强大工具集,性能在多基准测试超人类,但OpenAI因能力增强启动最高安全保障。

AI寒武纪
开源动态8

老黄入局吃龙虾!英伟达发布最强开源Agent推理模型

英伟达发布并开源120B参数的MoE模型Nemotron 3 Super,在多项测试中表现出色。它原生支持100万token上下文,吞吐量大幅提升。英伟达还计划五年投260亿美元构建开源AI模型,开放全参数权重等。

量子位
推荐文章7

在边缘应用中,实现 Kubernetes 的主动扩缩容

Kubernetes已成为现代IT核心平台,在云环境应用广泛。但在边缘计算场景,其HPA功能有局限。文章介绍基于CPA构建自定义扩缩器,详述其评估算法、实现方式,经测试CPA比HPA表现更优,适合边缘环境。

InfoQ
产品应用7

Target 公司借助生成式 AI 推荐将“加入购物车”互动率提升 11%

Target公司为应对零售目录中配套产品组合复杂挑战,部署基于生成式AI的配件推荐系统GRAM。它用大模型分析产品数据,结合人工审核,A/B测试显示提升了互动率和转化率,已全面投入生产。

InfoQ
产品应用7

The Batch: 964 | Claude 亮相另一款 Opus

Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。

DeeplearningAI
新闻资讯8

断网解题,Claude Mythos推翻Erdős 80年猜想!比OpenAI更短更漂亮

OpenAI用125页思维链解开Erdős 80年猜想,Anthropic研究员Levent Alpoge让Mythos断网测试,找到更短更简洁路径。Mythos用数论方法打破僵局,过去一周OpenAI、DeepMind、Anthropic分别攻克相关难题。

新智元
新闻资讯7

5月5日5点55分,GPT-5.5自己选客人开派对!Codex反超Claude Code

5月5日下午5:55,GPT - 5.5将举办派对,时间自定,客人由Codex挑选。过去两月,AI编程工具圈开发者从Claude Code转向Codex。虽Claude模型强,但工具体感上Codex占优。

新智元
新闻资讯8

曾对AI嗤之以鼻,如今2周生成7万行代码:Rust大佬与Claude联手打造新语言Rue

2025年,Rust社区早期核心人物Steve Klabnik心态转变,开始借助Claude编写代码。他重启念头设计新语言Rue,探索编程语言‘中间地带’,两周生成约7万行代码,开发中人与AI分工明确。

机器之心
开源动态8

智谱 GLM-4.7,Coding 开源第一,其他也很强

智谱正式发布并开源专为 Agentic Coding 打造的 GLM-4.7 模型,编程、推理、Agent 能力成绩亮眼,价格比 Claude Sonnet 4.5 更优。还推出 Coding Plan 套餐,使用方式多样。发布前几天,智谱港股招股书挂网。

AGI Hunt