「物理场景测试」共找到 3794 篇相关文章
全球首款AI原生游戏引擎再进化:GTA6再不来,我们就AI一个
GTA 6跳票成梗,其场景常被用于研究。一个多月前全球首个AI原生UGC游戏引擎发布,如今Mirage迭代为更强大的Mirage 2,支持多样场景,与Genie 3有不同优势且已上线,不过仍有技术问题待解决。
3D重建的惊人进展:多所世界名校联合发布论文,告诉你AI在3D世界的研究现状
多所世界名校联合发布调查研究论文,回顾用于3D重建和视图合成的前馈技术并分类,研究关键任务及应用。前馈模型打破每场景优化魔咒,带来速度和泛化能力的提升,解锁新应用,但也面临挑战。
AI 时代,编程语言选型更难也更重要:Go、Rust、Python、TypeScript 谁该上场?
AI 写码成常态,编程语言选择更重要。创业者 Armin Ronacher 指出语言权衡需重审,会影响 Agent 代码质量。他认为 Go 在 AI 场景合适,公司绕不开 Python 和 JavaScript。还分析多种语言特点、适用场景及 AI 对编程的影响。
Anthropic更新了Skill Creator,评测框架上线
Anthropic更新Skill Creator,上线评测框架。该框架无需写代码,能处理两类技能测试需求,可测试和改进技能,有捕获质量回归等用途。还增加基准模式、多Agent支持等,能让技能触发更可靠,更新已在Claude.ai等可用。
Claude时代终结?LMArena实测DeepSeek R1编程得分超Opus 4,但月暗称其新模型更胜一筹
在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分超Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩超R1。
Claude团队用Qwen测试全新训练方法
Anthropic最新研究提出中训练(MSM),在预训练后、后训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。
大模型如何赋能 Web 渗透测试?
文章指出传统Web安全检测有局限,而大语言模型(LLM)可提升漏洞发现覆盖率与准确性。以mcp server为基础介绍自动化漏洞检测方案,还分享实践操作、遇到的问题及解决办法,分析其优缺点并给出拓展思路。
Anthropic8张图,揭示Workflow & Agent的协作场景
文章借Anthropic的阐述,区分了Workflow与Agent概念。指出任务明确用Workflow,开放式问题用Agent,还介绍了构建blocks、workflows方法及Agent工作方式和实施原则。
AI PC,一场关于算力、场景与生态的远征
AI PC 市场竞争升温、格局重塑,本质是下一代计算入口争夺。英特尔通过硬件创新、生态共建等推动 AI PC 发展,在 2025 抖音商城秋上新秀展出相关产品,其酷睿 Ultra 处理器优势明显,市场呈多元竞逐态势。
The Batch: 929 | Qwen3.5 超越更大模型,领跑视觉基准测试
阿里巴巴发布 Qwen3.5 系列,含 8 个开源权重的视觉 - 语言模型。其小模型表现超大体量 OpenAI 开源权重模型,在视觉任务中整体出色,部分在语言任务也有竞争力。虽团队有人员离职,但阿里承诺加大 AI 投入。