「Claude4.5」共找到 3872 篇相关文章
击败 GPT-5!理想汽车开源 RubricHub:大模型开放生成从此有了专业裁判
理想汽车基座模型团队联合高校发布RubricHub数据集,解决开放式任务评价难题。该数据集可将主观评价转化为量化标准,经其训练的Qwen3 - 14B小模型在医疗基准测试中超越GPT - 5。
3B Image Captioning小钢炮重磅来袭,性能比肩Qwen2.5-VL-72B
文章推荐Dense Image Captioning新技术CapRL,它首次将DeepSeek - R1强化学习法用于image captioning,创新定义reward。训练的CapRL - 3B模型性能比肩Qwen2.5 - VL - 72B,解决了reward设计难题,已开源相关内容。
Claude Code + Kimi K2全栈开发教程,1小时上线「"丑咪"挑战赛」!
作者分享用Cursor + Claude code + Kimi K2开发「丑咪挑战赛」全栈项目的体验,介绍组合优势、接入教程、前端测试案例和使用技巧,认为Kimi K2在agent和coding能力上表现不错,适合作为Coding模型。
Claude Code一周份额,一天就烧完一半?有人逆向工程发现了7个bug
Claude Code在快速更新中问题频发,如思考深度大幅下降,还存在7个叠加的bug,浪费用户token配额。开发者给出应对建议,新版本增加账单透明度和缓存过期提醒,该工具正面临信任危机。
全网玩疯的SBTI,挤爆了服务器!网友用Claude手搓复刻版
全网被新型SBTI人格测试刷屏,服务器被挤崩。它解构MBTI框架,精准捕捉年轻人情绪。开发者用Claude Code完成逆向复刻,还做了改进。如今做产品门槛降低,未来SBTI或由AI打造。
不只是DeepSeek V4,还有个万亿级大模型,训推全程国产芯片
2026年4月24日,DeepSeek发布新一代模型DeepSeek - V4系列预览版并开源。同日,美团用全国产算力集群训练出万亿参数大模型LongCat - 2.0系列预览版,训推全流程摆脱英伟达,在国产算力支撑万亿级模型研发上取得突破。
Claude灾难级大宕机,全球开发者集体炸锅!Anthropic三连翻车被怒喷
4月6日Claude新功能Ultraplan上线就遭遇大规模宕机,开发者看到满屏‘授权失败’等。此前源码泄露,现又被指修改系统提示词报错、性能下降。虽Ultraplan有效果,但token消耗大,Anthropic太急,产品稳定性堪忧。
50个Agent分工干活,Kimi K2.5的Agent“军团”把我看呆了。。。
Kimi K2.5今日下午发布并开源,具备多模态能力。它能根据视频、链接等复刻网站,有Visual Edit功能且自动部署上线。还有Agent Swarm场景,多Agent协作解决复杂问题,应用体验佳。
国产模型编程能力卷到这个程度了?MiniMax-M2.5 深度实测
文章深度实测MiniMax-M2.5编程能力,用其开发多款游戏和点名工具,结果出色。还分析其底层技术,如原生Agent RL框架、过程奖励机制等,指出它性价比高,虽有不足但值得关注。
Deepseek V4 Pro发布,除了多模态,满足我对模型的所有想象
DeepSeek官方文档更新模型日期,意味着DeepSeek V4 Pro正式版来临,已在官方API提供。它采用MoE设计,接口能力强,Agent能力得到大幅强化,评测成绩亮眼,价格实惠且有API兼容性,不过有并发限制,近期还将上调价格。