「编程评测」共找到 1658 篇相关文章
程序员从此不再写代码!红杉专访Codex团队,o3白菜价真相曝光
红杉专访OpenAI Codex团队,揭示AI编程未来。Codex从代码补全演化为智能体,强调委托心态,开发者从动手转向审核。还爆料OpenAI内部有递归自我改进的AI Alice。
吴恩达来信:AI Fund 如何培养 AI 构建者
吴恩达分享 AI Fund 培养 AI 构建者经验,非工程背景同事从‘AI Python 入门课程’学起,掌握构建模块,还列举他们构建的应用示例,鼓励更多团队让人人有能力用 AI 构建。
快速理解热门LLM大语言模型
本文用通俗易懂方式帮读者理解LLM、Transformer、Prompt等基本概念,介绍大模型API使用,如温度参数、角色设定等,还提及Function Calling、Agent、MCP等内容,并对AI未来发展作出假想。
OpenAI很看好!首个SWE-1模型发布,软件开发或将提速99%
Windsurf发布首个前沿模型SWE-1,目标将软件开发提速99%。它不只能写代码,还能协助软件工程流程。有三个系列模型,SWE-1运行成本低,SWE-1-lite对所有用户开放,SWE-1-mini适用于低延迟场景。
Lex Fridman 对话 DHH:Omarchy,才是真正属于 Agent 时代的操作系统
Omarchy 有望成今年最火 Linux 桌面系统、首个 Agent 时代操作系统。开发者 DHH 曾怀疑 Agent 编程,现 Quattro 代码全由 Agent 编写。DHH 做客播客,谈 Omarchy、AI 时代操作系统变化等。
4.4w颗星!又一个CC Switch,几乎支持所有模型
Free CC(FCC)是本地 API 代理 + 协议转换层,能让客户端透明使用任意 OpenAI 兼容或专用上游模型,保留客户端能力。支持多提供商,架构分层、设计清晰,还有多种技术特性,文中给出安装、启动等步骤。
132万字实时字幕!阿里语音模型支持影视飓风100小时直播
阿里升级实时语音识别大模型Fun-ASR-Realtime,首字延迟在百毫秒级别、识别准确率接近离线模型。在影视飓风100小时直播中表现出色,还支持16种方言和30种语言,离线模型Fun-ASR-Flash全球权威榜单排第一。
突发,打工版Claude 5来了!人人都能用
Anthropic推出Claude Sonnet 5,代号Fennec。它性能直逼旗舰Opus 4.8,即日起成所有Free和Pro用户默认模型,能自主规划等。价格有促销,虽tokenizer或使花销增加,但仍比Opus划算,防护能力也强。
Agent不会搞科研?人大微软开源框架&工具包解决盲目试错通病,抱抱脸日榜第一
AI智能体虽能完成多项任务,但大多难以自主科研,易陷入盲目试错。人大和微软研究者提出Arbor框架与工具包,借助Hypothesis - Tree对优化空间结构化探索,多方面表现出色,荣登Huggingface日榜第一。
有人只用API就猜出了GPT、Claude、Gemini的参数量?社区吵翻了
研究人员李博杰在arXiv发布论文,提出“不可压缩知识探针”评测框架,仅通过黑盒API调用逆向估算LLM参数规模,给出GPT-5.5等模型参数量估算,引发社区广泛讨论与争议。