「代码测试」共找到 3141 篇相关文章
刚刚,Anthropic切开Claude大脑!AI自发长出类人「意识器官」
Anthropic开源「手术刀」J-Lens,读出Claude未说出口的念头。研究发现Claude自发长出类似人脑「意识」结构J-space,通过多项测试与全局工作空间理论对标,还表现出类似人脑的现象。
ClawdBot传疯了!视频教程来了
外网疯传的ClawdBot由开发者Peter Steinberger开发,能通过多平台交互干活。介绍其技术架构、两种设置方式、成本,还有安全设置、测试方法、进阶功能、使用场景及硬件选择等。
微软开源2025 ICML获奖框架,终结大模型多轮对话严重缺陷
微软开源2025年ICML获奖框架CoLLabLLM,可解决大模型多轮对话缺陷。它由四大模块构成,经多轮对话模拟和奖励优化模型。在三大基准平台测试显示,能在多样任务中高效协作。
Gemini 3 Flash 发布,多、快、好、省,Coding 能力不输大哥Gemini 3 Pro
Google DeepMind 发布 Gemini 3 Flash,成本极低。它在多项测试表现出色,速度快、效率高,代码能力超 Gemini 3 Pro,获企业客户好评,今日起向全球开发者和普通用户推送。
说实话提前拿到Qwen3.7-Max内测,最让我意外的不是它推理变强了!
作者提前2天拿到Qwen3.7-Max内测,经测试,该版本补齐短板,综合能力强。审美提升明显,代码质量不错,长程思考推理迭代能力佳,适合替换到部分工具里。
苹果与Anthropic合作,开发AI编程助手
彭博消息,苹果与Anthropic合作,为Xcode打造AI编程助手,集成ClaudeSonnet大模型,可自动完成代码编写等工作。现处内部测试,若顺利将向第三方开发者发布,有望改变苹果平台应用开发方式。
Agent创业者的天塌了,OpenAI发布ChatGPT Agent
昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。新模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5长文本推理专家,提供端到端长文本推理后训练“配方”,含数据合成管线、强化学习方法、智能体架构,在多基准测试成绩佳,代码已开源。
我给 Claude Code 加装了 MiniMax M2.5:它像“法拉利”,但更像一台工作机
作者给 Claude Code 加装 MiniMax M2.5 模型,测试其编程、上下文记忆等能力。M2.5 在多方面表现出色,能高效完成各类开发任务,还具备良好的中文处理能力,性价比高。
刚刚,Claude Code大升级!卡帕西:LLM第三次变革
Anthropic发布企业协作工具Claude Tag,定位为Claude Code进化版,更擅团队协作。约65%产品代码由其参与完成,卡帕西称是LLM用户界面第三次变革。它能深入企业工作流,已在Slack测试。