「Coding测试」共找到 2568 篇相关文章
OpenClaw 带来的「非线性狂飙」,代码正在成为新世界的基础设施
2026年初AI圈撕裂感十足,OpenClaw在GitHub获18.7万星标且还在涨,Claude Code等让开发者工作模式巨变,代码进化溢出,软件和代码质变,人类与代码关系倒置。
配置一改就要重启的时代结束了:Dev Proxy 2.1 正式上线
Dev Proxy团队发布2.1版本,围绕开发效率和本地测试体验更新,有配置热重载、stdio流量代理等新功能,还改进配置、性能及细节问题。Dev Proxy Toolkit 1.12同步发布。
马斯克视频生成模型首次交卷!电影级运镜+音效,免费可玩
xAI的“迄今为止最强大的视频音频生成模型”Grok Imagine 1.0正式全面上线。该模型支持文生视频、图生视频,音频效果出色,还擅长日常趣味创作。其在视频生成和剪辑性能领先,官网可免费玩。
当每个人都能指挥一支 AI 大军,什么能力最重要?
文章指出,在AI Agent增多的时代,管理能力是驾驭它们的关键。沃顿商学院教授提出判断是否委派任务给AI的公式,还建议从更好的指令、评估、反馈三方面提高成功率,同时给出委托任务和锻炼管理能力的方法。
蚂蚁抛弃向量推荐!用8B小模型构建「用户“话”像」,实现跨模型通用并拿下SOTA
2026年AI开发者关注爆款大模型应用,个性化是关键。蚂蚁集团和东北大学团队推出AlignXplore+,实现文本化用户建模新范式,有全域通用、极致迁移、实战适配特性,小参数超越基线,未来将继续探索。
拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”
现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。
AgentIF-OneDay 发布,评估全场景长时复杂任务
红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。
GPT-5.2考赢人类!OpenAI警告:大模型能力已过剩,AGI天花板不是AI
GPT - 5.2在ARC - AGI - 2基准测试超人类,Poetiq系统让其准确率从60%提至75%。OpenAI称大模型进入‘能力过剩’阶段,未来AGI进展不止靠模型,更需人机协同。
Andrej Karpathy:一场里氏 9 级的大地震正在重塑整个编程行业
文章围绕AI在编程领域的应用展开,作者与大师交流AI Coding方式,后提及Andrej Karpathy观点,指出编程行业正被重构,程序员需掌握新抽象层,应对不稳定智能系统。
关于Claude Skills,我给你写了份82页的白皮书
作者关注Claude Skills功能已久,使用后感受是它让Claude学会按需加载。还解析了Skills、MCP、Sub - agents区别,指出有人认为Skills比MCP更重要,最后介绍82页白皮书内容及获取方式。