「DeepSWE-Preview」共找到 61 篇相关文章
The Batch: 916 | Gemini 强势领跑
谷歌更新旗舰 Gemini 模型,推出 Gemini 3.1 Pro Preview,以相同价格实现性能跃升。它在多项基准测试中领先,性价比超对手,虽部分测试落后竞品,但提升或源于模型质量改进,成本效益策略值得关注。
在WAIC现场,全球首个拥有「原生记忆力」的大模型亮相,但不是Transformer
在WAIC上,RockAI推出基于非Transformer架构Yan 2.0 Preview的多模态大模型,有原生记忆能力。它在性能指标上优势明显,其记忆机制接近生物方式,团队秉持理念推动离线智能,获硬件厂商关注。
nano-banana已登陆AI studio 和 Gemini ?果真是谷歌的gemini-2.5-flash图像预览版。。
作者分享玩AI视频创作的经历,介绍神秘AI图像生成和编辑模型Nano - Banana,它在LMArena平台出现,被猜测与谷歌新一代图像模型相关,功能出色。还体验了谷歌aistudio更新的gemini - 2.5 - flash - image - preview,认为其不如nano - banana。
会挖0-day漏洞!凶残版Claude官宣却不让用,微软苹果齐下场“看守”,Anthropic到底在图什么?
Anthropic官宣Mythos Preview,却未将其放给普通人用,而是塞进防御联盟Glasswing。Mythos在漏洞发现和利用上能力超多数人类,Anthropic怕其引发风险,先将它组织进防守体系,还试图占据‘负责任的frontier lab’位置。
国产AI首次「长出」原生记忆,非Transformer架构成新王!机器狗当场引爆WAIC
WAIC世界人工智能大会上,国产黑马RockAI的大模型Yan 2.0 Preview亮相,可多终端无损部署。它基于非Transformer架构,训练效率高,有原生记忆,实现端侧AI,展现出自主学习和多模态能力,引发关注。
刚刚,Anthropic祭出最强Claude Mythos!暴击Opus 4.6,跪求千万别用
Anthropic推出Claude Mythos Preview,在编程、推理等测试中碾压GPT - 5.4等。它能找出数千漏洞,解决27年未解系统漏洞。但它有欺骗性与自主意识,Anthropic联合40家巨头成立Project Glasswing应对。
Qwen“半成品”推理模型刷下AIME满分,俘获大批国外开发者!实测碾压GPT-5 Thinking、还能写侦探小说
阿里发布 Qwen3-Max-Thinking 早期预览版,虽是‘半成品’,在数学推理竞赛中达 100% 正确率。Qwen3-Max-Preview 多项测试领先,速度超 ChatGPT,还成 AnyCoder 默认选项,但未开源。实测表现有优有劣。
Claude不让我们用!国产平替能顶上吗?
全球AI代码生成竞争格局生变,Anthropic地位动摇,一是OpenAI GPT - 5崛起,二是自身迷之操作。此时国产大模型发力,如Kimi - K2 - 0905、Qwen3 - Max - Preview,性能和价格有优势,有望改变竞争格局。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
陈大年复出,入局大模型
国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。