编程基准测试」共找到 2966 篇相关文章

产品应用8

Qwen3.8-Max首发上线阿里千问AI平台,API服务与Token Plan同步开放

今日,阿里巴巴发布新一代基座大模型Qwen3.8,千问AI平台首发其Max版API服务与Token Plan。Qwen3.8参数量2.4万亿,性能居前列,推理快且能自主编程。API性价比高,平台还为Token Plan用户提供优惠。

阿里云开发者
新闻资讯7

deepseek v4.1? 梁圣的端午礼物突袭。

群里小伙伴称deepseek官方灰度新模型,手机和web端Flash模型思考模式大变,典型bug修复。测试发现幻觉严重,知识库截止大概25年6月。同时,deepseek获500亿首轮融资,梁文锋自掏200亿,投资方无投票权,五年锁定期。

探索AGI
推荐文章8

甲小姐对话郝景芳:从北京折叠到AI折叠 | 甲子光年

这是甲小姐与郝景芳的对话,探讨AI对工作、社会、教育等方面的影响。郝景芳分享创业经历,谈AI编程体验,分析AI时代公司组织、就业、社会阶层变化,还探讨AI应用、素养普及、人类角色等问题,表达对人性和社会发展的看法。

甲子光年
产品应用8

给 Happy Horse-1.0 讲完戏,我无痛当上导演了

文章聚焦阿里新发布的视频模型Happy Horse-1.0,经测试它在多镜头一致性、人物表现力和视频编辑功能上表现出色,能产出电影质感画面,且价格有竞争力,但物理拟真短板明显,已具影视工业应用潜力。

AI科技评论
推荐文章8

OpenAI 设计师:不写代码的设计师,将成为团队瓶颈

OpenAI 的 Ed Bayes 和 Figma AI 设计总监 Gui Seiz 深度对谈,探讨 AI 打通编程与设计工具后设计师工作流程的变化。涉及画布与代码的使用、代码与设计稿同步、实际应用效果、工作方式转变等内容,还给出新手入门建议。

AGI Hunt
算法论文8

刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

腾讯混元团队和复旦联合团队发布姚顺雨署名首篇论文《CL - bench》。论文证实模型在上下文利用上有能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。

机器之心
产品应用8

千问App更新之后,所有人都该重估阿里|甲子光年

千问App 6.0版本更新,全面接入阿里生态业务,开放400多项办事功能,面向所有用户测试,成为全球首个能完成复杂生活任务的AI助手。它重构交互逻辑,推动“去App化”,让阿里凭生态优势领跑AI下半场。

甲子光年
新闻资讯7

Claude版Manus只用10天搓出,代码全AI写的!网友:小扎140亿并购像冤大头

Claude Cowork是面向工作场景的通用智能体,基于Anthropic自研模型打造。开发约10天,代码全由Claude Code写,人类仅负责规划等。它让非编程用户能用AI能力,这让扎克伯格20亿买Manus的操作显得冤。

量子位
新闻资讯7

智能体崛起,AI+软件研发到新拐点了?

InfoQ《极客有约》X AICon 直播探讨 LLM 时代软件研发新范式。嘉宾认为 AI 在研发中是提效工具,距原生开发尚远;部分开发环节已由 AI 接手,落地面临稳定性等问题;未来智能体协作是趋势,部分工程师价值将放大。

InfoQ
算法论文8

DeepMind爆火论文:向量嵌入模型存在数学上限,Scaling laws放缓实锤?

DeepMind一篇关于向量嵌入局限性的论文在AlphaXiv爆火。其证明向量嵌入有数学上限,Scaling laws或放缓。研究构建LIMIT数据集,测试发现即便是先进嵌入模型也难解决简单任务,揭示了RAG系统约束,让人反思Scaling Laws边界。

机器之心