「传统软件测试」共找到 3182 篇相关文章
Anthropic宣布练出神话级模型:Claude Mythos,代码和黑客能力吊打opus4.6,不向公众开放!
Anthropic宣布Project Glasswing计划,因训练出超强模型Claude Mythos Preview。该模型代码和推理能力超opus 4.6,扫描主流软件发现数千零日漏洞。此模型不向公众开放,计划先在Claude Opus验证安全机制。
Karpathy强推,大厂抢着「复古」命令行,Star数全都上千了
飞书、钉钉、企业微信接连推出 CLI,GitHub Star 数上千。CLI 是传统人机交互方式,契合大语言模型运作逻辑,国内外多家公司及项目推出相关工具,还给出为智能体构建 CLI 的设计模式。
732M模型超越7B!机器人操控新范式:从视频中「悟」物理
机器人操控有「数据困境」,传统方法需大量人工标注动作演示数据。中山大学王广润教授团队从视频生成模型「借」物理直觉,提出PAR和PhysGen,与英伟达DreamDojo核心思路一致,验证了新的技术路线。
全网疯传!Claude最新模型意外曝光:全面碾压Opus 4.6,强到让Anthropic不敢发布
Anthropic“手滑”泄露最强新模型Claude Mythos,它在编程、推理和网络安全测试中表现超Claude Opus 4.6。因模型“黑客能力”强,Anthropic发布谨慎。此外,该公司还意外泄露3000多未发布文件。
我在微信免费养「龙虾」,玩到上瘾,这组CP太强了
2026 开年「龙虾热」渗透各类任务场景,腾讯动作密集。其自研 WorkBuddy 优势明显,与微信 ClawBot 联动成「官配」。经测试,它能高效处理多类任务,还为用户提供权益,腾讯龙虾矩阵加速成形。
文言文秒杀所有大模型!100%攻击成功,轻松突破安全防线
南洋理工等机构团队提出基于文言文语境的自动化黑盒测试框架CC - BOS,利用果蝇算法和8维策略空间,暴露主流大语言模型安全盲区,实验显示对6款主流模型攻击成功率达100%。
AI屠刀下一站“Vibe设计”!谷歌一个产品把合作伙伴Figma干崩了
3月18日谷歌宣布旗下AI设计工具Stitch支持Vibe Design,用户可用语音设计UI和前端界面。消息一出,Figma股价暴跌,Adobe股价也下跌。Stitch有五大能力升级,与Figma功能重叠,谷歌靠免费、分发、捆绑或吃掉市场份额。
做RAG这一年,最后悔的就是上知识图谱
基于知识图谱的检索增强生成在问答任务中存在三元组索引丢失上下文语义问题,作者提出MDER - DR双阶段框架,在标准测试和特定数据集上性能提升最高66%,还具备多方面优势。
The Batch:924|GPT-5.4:性能更高,价格也更高
OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。
大象秒变挖掘机!三维变形新突破,无需额外训练 | CVPR'26
南京大学与北京大学提出MorphAny3D,无需额外训练即可让三维生成模型实现跨类别平滑变形。它通过创新注意力机制融合源与目标特征,精准控制结构与时序,效果远超传统方法,代码已开源。