「Claude 3.7 Sonnet」共找到 3602 篇相关文章
OpenClaw大考!上海AI Lab InternLM团队WildClawBench 60题,把「龙虾」AI打回原形
上海人工智能实验室InternLM团队推出WildClawBench,含60道高难度任务,在真实OpenClaw环境端到端评测AI Agent。评测涵盖多类别任务,已测14个模型,国产模型表现亮眼,项目开源可复现。
AdaGen: 让图像生成模型学会自适应策略
当前主流图像生成模型多步策略依赖手工静态调度规则,存在需大量调参、无法适配样本特性的问题。本文提出AdaGen框架,通过强化学习训练策略网络,在四大生成范式上实现性能提升与效率优化。
一个App管好所有Agent技能,Chops来了
Chops是一款macOS应用,能自动发现所有AI coding agent的技能文件,支持Claude Code、Cursor等工具。功能丰富,技术栈纯粹,需macOS 15 Sequoia及以上,下载地址和文档在GitHub。
4·18 北京 Elastic AI Tech Day|搜索基座模型议程(含 Jina 模型与 Reader)
Jina AI 模型迭代加速,Jina Embeddings 到五代目,Reranker v3获最佳论文。4月18日 Elastic AI Tech Day 将举办,Jina 团队将做系统公开技术分享,涵盖搜索AI等多方面内容。
破解大模型「无效并行推理」:Parallel-Probe问世,并行推理效率提升35.8%
来自多所高校的研究团队提出 Parallel-Probe,通过 2D Probing 刻画并行推理动态,发现问题后提出控制算法,能降推理延迟 35.8%、总 token 成本 25.8%,还推出 SCOUT 测试床,代码和平台已开源。
硅谷深夜不写一行代码!放羊大叔Ralph引爆奇点,睡一觉AI全跑通
放羊大叔Ralph Loop掀起生产力革命,无需手写代码,AI就能搞定软件开发。它把任务拆到最小颗粒度解决普通AI崩溃痛点。还介绍融入工作流的方法、运行方式及成本,强调掌握此技能的重要性。
FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性
FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。
牛,AI 写代码进入“编排时代”:Vibe Kanban 让多个 Agent 并行干活~~~
用Claude Code等写代码常需排队,Vibe Kanban思路直接,把AI coding agent当“同事”,用看板分配任务、并行跑多agent、可视化review改动。它亮点多,有多种使用场景,5分钟可上手。
2025年度盘点·值得一看的50件文化遗产创新作品
文章对MANA网站优秀创作者2025年上传作品做年度盘点,精选50件文化遗产创新作品。这些作品用当代语言和技术,让文化遗产不再是陈列品,而是可被感知的文化现场,探索文化当下生长与未来延展。
性能不减,吞吐量提升6.4倍!英伟达用混合算子和架构定义小模型新标准
NVIDIA研究团队通过Nemotron - Flash系列模型,打破对‘深而瘦’架构迷信,修正缩放定律,用进化算法搜索混合算子、改进训练策略。该模型在性能、延迟和吞吐量上表现出色,远超同类产品。