「GPT - 5.1 Codex Max」共找到 3753 篇相关文章
Fable 5解禁即翻车!写一行代码就降智,开发者破防
消失19天的Fable 5解禁即翻车,因过度审查和双标机制,让开发者破防。但抛开护栏,它执行复杂任务能力强。A社同期发布的Sonnet 5也遭群嘲,此外,A社还提出评估框架并向政府让步。
GLM-5封神,智谱市值五天翻倍,中国AI火力全开了
2026年春节档,字节跳动的Seedance 2.0与智谱GLM - 5成AI赛道“双子星”。GLM - 5在Coding领域开源与实战表现出色,标志中国AI迈向成熟。它能力比肩闭源模型,且配套工具链完善,还适配国产芯片。
TokenDance 首发上线 GLM-5.2,内测一周后今日正式开放
今日,TokenDance 平台首发接入智谱最新旗舰模型 GLM-5.2 并面向外部用户开放。它是面向开发者与企业的大模型聚合平台,用户接入一个 API Key 就能调用多种主流大模型。此前团队已对 GLM-5.2 深度内测与适配。
程序员从此不再写代码!红杉专访Codex团队,o3白菜价真相曝光
红杉专访OpenAI Codex团队,揭示AI编程未来。Codex从代码补全演化为智能体,强调委托心态,开发者从动手转向审核。还爆料OpenAI内部有递归自我改进的AI Alice。
Claude Opus 4.1代码实测惊人!OpenAI开源模型却只会写屎山?
昨日,OpenAI、谷歌和Anthropic等发布新模型。Anthropic推出Claude Opus 4.1,虽性能提升不大,但编码能力获大客户认可。实测显示Claude - Opus - 4.1写代码稳,OpenAI新模型表现不佳。
测评豆包1.6:我用它开发了一个“聪明的旅行策划Agent”
作者对豆包1.6进行测评,用其构建旅行策划Agent。豆包1.6推理强、有自适应思考模式且计价创新。作者实操构建旅行Agent,结合MCP完成任务,虽有不足但超预期,国内Agent开发生态已成熟。
DeepSeek开源新基础模型,但不是V4,而是V3.1-Base
昨晚深度求索宣布DeepSeek线上模型版本升级至V3.1,在Hugging Face发布新模型DeepSeek - V3.1 - Base。该模型是V3系列最新基础模型,发布后冲上Hugging Face热门榜第4位,社交网络看法不一。
“额度想重置就重置,不问财务”,Codex Tibo首曝幕后:产品没做好,就补偿用户
围绕 Codex 与 Claude Code 使用额度问题,社区不满额度机制不透明不可预测。Codex 团队 Tibo 公开额度重置逻辑源于补偿,并非营销。此外,还谈及产品融合、技术创新、算力决策等多方面内容。
阿里开源QwenLong-L1:首个以强化学习训练的长上下文推理大模型
LRMs扩展到长文本场景是挑战,阿里开源QwenLong-L1框架,是首个用强化学习训练用于长文本推理的模型。它含三个核心组件,QwenLong-L1-32B性能领先,与Claude-3.7-Sonnet-Thinking相当。
Qwen团队发布长上下文Reasoning模型QwenLong-L1,超越o3-mini
Qwen团队发布长上下文Reasoning模型QwenLong - L1。当前大模型处理长文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。