「中美 AI 竞争」共找到 9977 篇相关文章
The Batch: 978 | DeepSeek-V4-Pro 更新了
DeepSeek发布旗舰模型DeepSeek-V4-Pro-0813正式版,性能提升,还发布开源agent harness开发者预览版并提价。模型在多指标表现佳,编码能力改进明显,公司公开基准测试框架意义大。
HarnessEval 来了!开启 RSI 时代的新评测范式!
过去一年AI进入RSI时代,但评测方式仍停留在过去。MirroS联合多方发布HarnessEval,将Harness引入评测领域,使评测成为具备自我进化能力的智能系统,还率先应用于交互式世界模型评测。
史上最大IPO要来了
据英国《金融时报》,全球头部AI企业Anthropic最快10月上市,估值或达2万亿美元,将超SpaceX成史上最大IPO。其营收增长快,靠编程等企业级业务逆袭,还引得众多科技资本下注。
梁文锋、马斯克同时开火!DeepSeek V4 Pro,Grok 4.6 发布
刚刚,DeepSeek悄悄上线DeepSeek V4 Pro正式版,马斯克高调推出Grok 4.6,两者性能直逼顶级闭源甚至有超越。每百万输出Token,Grok 4.6和DeepSeek价格优势明显。两者在多项评测中表现出色,且后续还有大招。
梁文锋突袭马斯克!DeepSeek V4 Pro对战Grok 4.6,首测夯爆了
梁文锋凌晨发布DeepSeek V4 Pro正式版,马斯克推出Grok 4.6,二者在多项评测中表现出色,直逼OpenAI和Anthropic顶尖模型,还降低了前沿智能价格。首测中,二者在真实任务场难分伯仲。
Claude骂声中启动「隐形水印」:新模型全量嵌入,标记所有文字
Anthropic宣布新款Claude将在生成文本中嵌入隐形水印,还会给特定文件附加数字签名元数据,全球统一施行。此前A社就用Unicode贴暗标,虽称不影响生成质量,但遭质疑。
刚刚!Claude Fable 5,又拿第一了
在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率登顶,成绩远超其他模型。它在不同语言上表现稳定,在稀缺语言中也只小幅度下降。这意味着前沿模型能独立完成部分中大型软件。
丛乐创办Acelegen:用基因编辑让活细胞成为可编程计算平台
过去五年AI重塑生物技术。CRISPR基因编辑技术开发者丛乐联合创立Acelegen,集成过往成果,欲把活细胞变成可编程计算平台,其愿景是找到“生命的Scaling Law”,独特性显著但答案待揭晓。
DeepMind大佬最新暴论:单体大模型穷途末路,未来买的不是模型,是"智能路由"
DeepMind研究员Andrew Trask认为,因Scaling Law对资源需求攀升,AI将成协议而非程序。组合不同厂商模型有优势,当主流榜单同等评分时变革加速,之后人们将买“智能本身”。
Claude仅用8分钟,5年未解Bug秒破!
知名硬件钱包Coldcard因五年代码漏洞暴雷,此前Coldcard团队多次更新审查未查出,开发者用Claude仅8分钟就找到。此前国会闭门演示展示Claude挖漏洞能力,Anthropic复盘还曝光Claude等模型「暴走」情况。