「Claude-Sonnet-4.5」共找到 3895 篇相关文章
Skills:从编程工具的配角到Agent研发的核心
文章探讨了Skills在AI Agent发展中的价值演变与适用场景,指出其价值具高度场景依赖性。在Claude Code编程工具中它表现平淡,在Agent研发中价值凸显,还给出使用场景判断维度与发展方向。
The Batch: 896 | 教会模型说出真相
大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型在多项评测中多能承认问题,自白机制可监控模型行为。
奥特曼考虑给ChatGPT加广告了!用8亿用户,救万亿债务
OpenAI凭ChatGPT有8亿周活与约130亿美元年收入,因订阅难覆盖成本考虑加广告,还获软银巨额投资,豪赌算力扩张;Anthropic低调攻企业,Claude在专业领域强,收入逼近OpenAI一半,打法稳健。
ChatGPT最强网络安全模型,逼谷歌紧急修漏洞!
OpenAI推出安全专用模型GPT-5.6-Cyber,用于处理信息安全任务。它战绩斐然,发现诸多内核漏洞。Daybreak计划为安全人员提供工具。该模型虽有不足,但展现出强大的网络安全能力。
大模型能复刻这些系统吗?ProgramBench给出了残酷答案
斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。
刚刚,DeepSeek多模态技术范式公布,以视觉原语思考
DeepSeek发布多模态模型并公布技术报告,提出‘以视觉原语思考’。该模型解决多模态大模型‘指代鸿沟’问题,有把坐标变思维单元、7056倍视觉压缩、精心设计冷启动数据等创新,实验在多任务上超主流模型。
Anthropic出手,一批Agent创业公司死去
Anthropic推出Claude Managed Agents,号称几天就能上线生产级智能体。它提供全托管、开箱即用的智能体基础设施,让传统SaaS公司与AI初创公司面临危机,AaaS时代正开启。
记录下SGLang开发,优化,debug的技巧之大SKILL时代已来临
文章记录SGLang开发等技巧,介绍Agent在编程开发领域的强大能力,如完成多种工作、提升模型速度。还提及Agent流程优化方向,提醒警惕其偏差,指出人的价值转变,成为设计、把关和提炼者。
Redis之父:手写代码?醒醒吧除非你图一乐
Redis之父Antirez在博文指出,编程已被AI永远改变,手工写码不再明智。他用实测案例展示Claude Code强大效率,警告程序员别喝‘反AI迷魂汤’,应重构工作流拥抱AI。
新玩法!Karpathy周末手搓“大模型智囊团”应用:各大LLM同台互评,代码已开源
Andrej Karpathy周末手搓Web应用llm - council,让多个大模型像顾问般提供建议。查询通过OpenRouter分发给多个大模型,它们互评后由‘大模型主席’生成最终回复,代码已开源。