「Coding 基准测试」共找到 2878 篇相关文章
Target 公司借助生成式 AI 推荐将“加入购物车”互动率提升 11%
Target公司为应对零售目录中配套产品组合复杂挑战,部署基于生成式AI的配件推荐系统GRAM。它用大模型分析产品数据,结合人工审核,A/B测试显示提升了互动率和转化率,已全面投入生产。
全新唇同步技术OmniSync,遮挡,侧脸不在话下
唇同步对创建逼真视频内容很重要,但现有方法在身份一致、姿势变化等方面有局限。中国人大携手快手提出OmniSync,引入无需掩膜的训练范式,保证身份和姿态一致,能适应复杂场景,还建立AIGC - LipSync基准。
The Batch: 964 | Claude 亮相另一款 Opus
Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。
断网解题,Claude Mythos推翻Erdős 80年猜想!比OpenAI更短更漂亮
OpenAI用125页思维链解开Erdős 80年猜想,Anthropic研究员Levent Alpoge让Mythos断网测试,找到更短更简洁路径。Mythos用数论方法打破僵局,过去一周OpenAI、DeepMind、Anthropic分别攻克相关难题。
突发!你关注的AI博主被「焦点访谈」报道了!
AI博主花叔上了央视《焦点访谈》,他曾靠AI coding能力做出付费榜第一的App。时隔一年多再次被报道,他认为是时代需要这个故事。此外,他的开源项目「女娲.skll」已突破20000+stars。
首次!Meta证实LLM评审不可信!
Meta和耶鲁论文揭示,用AI当裁判训练弱模型时,学生模型会“糊弄”裁判,思考派裁判也难防,还给出从业者启示,如别迷信单一基准、裁判要进化、保留人类评估。
Anthropic发布循环设计指南:权威拆解当下最火的AI新范式loop
Claude Code团队明确loop定义,将其分四大类,给出选择循环及控制Token消耗的实用指南,还介绍保持代码质量方法,最后总结各循环适用场景、建议功能,指导用户开始使用。
Meta提出数据筛选的理论:何时“少即是多”成立?
Meta针对机器学习领域‘少即是多’悖论提出理论框架,用高维统计等方法推导测试误差缩放定律,揭示数据筛选‘相变’条件,为实践提供指导,还重新定义‘数据效率’意义。
物理AI的「原生」时刻:原力灵机发布具身大模型DM0
主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。
Google 新论文离谱到家了,0延迟0成本通用,提升大模型准确率最简单的方法。
Google新论文提出简单提升大模型准确率的方法,即重复提示词,把完全一致的输入连续发2次。主流模型适用,经70项benchmark测试,0场景效果倒退,47个场景准确率提升,且几乎不增延迟、成本。