「Claude新模型」共找到 10134 篇相关文章
Notion、Stripe 都在用的 Agent 监控,Braintrust 会是 AI-native 的 Datadog 吗?
当 Agent 迈向产品化,开发者面临观测、评估和优化黑箱系统的挑战。Braintrust 由 Ankur Goyal 于 2023 年创立,重塑 Observability,提供 Eval 和 Ship 模块,获多家头部公司青睐与投资。文章从多方面剖析其能否成 Agent 时代‘新 Datadog’。
图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果
百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。
地理学的AlphaEvolve?MIT斯坦福让AI自我生长、懂地理、懂世界
MIT和斯坦福学者提出GeoEvolve,把地理知识「嵌入」AI,让其成为能自主改进算法的科研合作者。它有双循环机制和四个核心模块,输入简单,开源为Python包,改进Kriging模型效果显著。
刚刚,GPT-6代号再泄露!或将周四见
据传GPT - 6本周将发布,OpenAI「义父」爆料Codex接入最强Astra模型,其内部代号「mewfour」泄露。Astra内部版已解决多个数学难题,成本仅约2000美元,还或达网络安全最高能力阈值,可能开启多智能体原生时代。
LLM规划能力飙升79%!Google:内在自我批评技术拿下多项SOTA
Google DeepMind研究《通过内在自我批评提升大语言模型的规划能力》,不借助外部验证器,让LLM反复“自评+重写”,使Blocksworld准确率从49.8%升至89.3%,还介绍了方法及跨模型验证情况。
GPT-6 Sol要来了?OpenAI本周或迎「发布狂潮」
本文爆料OpenAI核心人员预告本周将迎来DevDay级别的大规模产品更新,网传GPT-6 Sol已进入灰度测试,OpenAI正推动旧模型迁移,本轮更新覆盖新模型、多模态、智能体等多个领域。
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
斯坦福临床医疗AI横评,DeepSeek把谷歌OpenAI都秒了
斯坦福最新大模型医疗任务评测,构建含35个基准测试的MedHELM综合评估框架。结果显示,DeepSeek R1以66%胜率领先,o3 - mini等模型也各有表现,还分析了成本效益。
OpenAI一个月跑4名高管!前COO离场,安全线几乎被一锅端
OpenAI近期人事变动频繁,前COO Brad Lightcap宣布离职,称想做新东西。近一个月内,伦理、未来学、安全系统主管也纷纷离开,安全线几乎被一锅端,同时还面临安全争议,最强模型Astra发布推迟。
清华万引教授:万倍加速催化剂设计,AI突破DFT瓶颈!
清华大学王笑楠团队提出催化剂设计新基础模型SurFF,发表于Nature Computational Science。它无需昂贵实验或耗时DFT计算,实现对金属间化合物表面暴露与形貌的高效、高精度预测,计算速度提升10⁵倍。