编程能力评估」共找到 4438 篇相关文章

产品应用8

天选Windows打工AI来了!实测完Claude Cowork国产版:超顶

硅谷Claude Cowork出圈后,国产昆仑万维Skywork桌面版登场。它支持模型自由切换、海量Skills集成,实测任务完成率高、速度快、有自纠错机制,依托上下文能力升级,是国产AI创新力量的展示。

量子位
产品应用7

独一份!带动效的 PPT 生成 Agent!使用教学&创作思路

作者实现用 Nano Banana Pro 生成带演示动画的 PPT 这一独特功能。介绍了更新后的 PPT 生成 Skills 能力、使用方法、创作思路,还提及成本及对 AI Coding 发展的看法。

歸藏的AI工具箱
新闻资讯7

Meta CTO打脸扎克伯格:首秀翻车全因致命bug,AI智商捉急、语音交互全面崩盘

Meta Connect开发者大会上,Meta发布三款智能眼镜,现场演示却屡屡翻车。扎克伯格归咎于Wi-Fi,CTO Bosworth否认,称是资源管理失误和软件bug所致,但网友对此解释并不买账,质疑团队能力

InfoQ
算法论文8

OpenAI罕见发论文:我们找到了AI幻觉的罪魁祸首

AI“幻觉”是阻碍完全信任AI的关键障碍,目前无根治良方。OpenAI罕见发论文揭示其根源,指出标准训练和评估程序奖励猜测,应加大对自信错误的惩罚,奖励表达不确定性。

机器之心
新闻资讯7

用户集体大逃亡!Cursor“自杀式政策”致口碑崩塌:“补贴”换来的王座,正被反噬撕碎

很多开发者吐槽和弃用 Cursor,其付费后砍功能、技术变差、营销成“障眼法”,引发信任危机。部分用户转向 Claude Code,AI 编程工具竞争焦点升级,未来有向智能体演进等趋势。

InfoQ
新闻资讯8

OpenAI深夜放出GPT-5狙击谷歌!基准测试碾压前代模型,价格比Claude更便宜

北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推两款新模型,介绍了不同用户套餐。它在编程基准测试表现佳,健康领域能力突出,引发各界热议。

AI前线
新闻资讯7

独家专访FF创始成员:造车11年交付16辆,贾跃亭为什么还没失败|甲子光年

贾跃亭创办法拉第未来11年,仅交付16辆车。今年他推出新车FX Super One进军MPV市场,引发“抄袭”争议。贾跃亭靠“桥梁战略”“开源节流”和“个人资源能力”让FF存活,该车能否如期销售待察。

甲子光年
新闻资讯7

陶哲轩回应OpenAI宣称内部实验模型获得IMO金牌:不予置评「测试方法不公开就是“作弊”?」

OpenAI宣称内部实验模型获IMO2025金牌,陶哲轩呼吁对AI竞赛表现保持审慎。他强调评估AI不能只看结果,测试方法很重要,对未公开测试方法的自我报告成绩不予置评。

AI寒武纪
产品应用7

Claude Code发布4个月,用户已经11.5万了,开发者:200 美元/月不算贵

Anthropic的Claude Code发布4个月吸引11.5万开发者,一周处理1.95亿行代码。它集成Claude Opus 4模型,功能实用,口碑好,让开发者觉得物有所值,反映开发者对AI编程工具接受度提升。

机器之心
推荐文章8

Agent Infra 赛道更新,一年后为 Agent 设计的基建发展如何?

过去一年,Agent 产品形态和使用方式变化大,其基建 Agent Infra 竞争格局也在变。它需解决让 Agent 更可控和接入更多能力两个问题,涉及 Runtime、Identity 等多方面,不同方向发展阶段和前景各异。

海外独角兽