编程评测」共找到 1658 篇相关文章

开源动态8

通义实验室正式开源 Mobile-Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI-Owl-1.5

通义实验室正式开源 Mobile - Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI - Owl - 1.5。该模型有多档参数可选,分 Instruct 和 Thinking 版,支持多平台。它解决了高质量数据难搞定等痛点,评测表现良好。

深度学习自然语言处理
新闻资讯7

OpenAI发布GPT-5!这是一篇很主观的解读...

OpenAI发布GPT - 5,一口气推出三个版本API。发布会图表出错被吐槽,其自适应思考能力似抄Claude作业。发布会重押编程能力,因Anthropic靠Claude在API市场抢了不少写代码用户,实测中GPT - 5与Claude 4.1表现接近。

花叔
推荐文章8

Karpathy的软件3.0:Agent的原生世界

OpenAI联合创始人Andrej Karpathy在Sequoia Ascent大会上表示,AI Agent正改变软件与工作模式。编程基本单位从写代码变为给Agent下达指令,软件3.0以上下文窗口为程序,LLM为解释器。他还提出理解AI能力分布的框架,给出创业建议。

AIGC开放社区
新闻资讯8

梁文锋、马斯克同时开火!DeepSeek V4 Pro,Grok 4.6 发布

刚刚,DeepSeek悄悄上线DeepSeek V4 Pro正式版,马斯克高调推出Grok 4.6,两者性能直逼顶级闭源甚至有超越。每百万输出Token,Grok 4.6和DeepSeek价格优势明显。两者在多项评测中表现出色,且后续还有大招。

AIGC开放社区
产品应用8

Deepseek V4 Pro发布,除了多模态,满足我对模型的所有想象

DeepSeek官方文档更新模型日期,意味着DeepSeek V4 Pro正式版来临,已在官方API提供。它采用MoE设计,接口能力强,Agent能力得到大幅强化,评测成绩亮眼,价格实惠且有API兼容性,不过有并发限制,近期还将上调价格。

鲸选AI
算法论文7

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。

机器之心
开源动态8

杨植麟亲自发布,月之暗面最强模型Kimi K2.5开源

杨植麟发布月之暗面最强模型Kimi K2.5,经约15万亿视觉与文本混合数据预训练,有顶尖编程与视觉能力及智能体蜂群范式。在多基准测试表现优,成本低于对手,还能提升办公生产力。

AIGC开放社区
新闻资讯8

Ilya重新定义AGI: 为什么ChatGPT离真正的AGI还很远

OpenAI前首席科学家Ilya在访谈中提出对AGI的新定义,还指出AI规模时代结束,未来拼想法和研究深度。他分析模型评测强但经济影响弱的原因,阐述人类价值函数作用,且SSI战略或调整。

花叔
新闻资讯7

谷歌新版Gemini马甲被扒! LMArena实测:唯一能看懂表的AI, GPT-5乱答

谷歌Gemini 3.0疑似上线LMArena,其Pro和Flash马甲被扒。实测中,Gemini 3 Pro能精确看表,GPT - 5等表现不佳;SVG测试有提升但也有不足;还能作曲。不过评测方式老套,希望有新花样。

新智元
开源动态7

小红书发布 SWE-Bench Mobile:当 AI Agent 面对亿级用户 App 代码库,最高通过率仅12%?

小红书联合多科研机构发布 SWE-Bench Mobile,它是首个还原‘端到端’开发流程的基准,以小红书 App 实际任务为核心。评测显示,AI Agent 在移动端开发能力上限低,架构设计比模型本身重要,简单提示策略效果更好。

InfoQ