「进化式评测系统」共找到 2747 篇相关文章
Anthropic长文:多智能体协作模式,五种方法及其适用场景
Anthropic官方长文总结5种多智能体协作模式及适用场景,指出何时用多智能体或单智能体更好,还分析各模式工作机制、适用场景、易翻车点,给出架构选择和新手操作建议。
智谱发布龙虾基座模型GLM-5-Turbo,还适配了一个养龙虾的盒子
智谱发布专为龙虾场景深度优化的基座模型GLM - 5 - Turbo,从底层训练重塑,增强四项核心能力。发布评测基准ZClawBench,模型表现领先。还推出龙虾套餐和安全管理体系,助力企业实现算力自由与安全管控。
红杉的投资哲学和秘密武器,a16z 投了个很有意思的 AI 学习产品
文章分享红杉投资哲学与秘密武器。决策重信念而非共识,管理赋能‘异类’人才,聚焦可控‘输入’,筛选要有勇气。还提到其‘人才佩奇排名’系统,此外介绍a16z投资的AI学习产品。
VaseVQA:考古领域实现专家级,诊断+补弱RL框架
在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。
规范对齐:回答前的深思,让安全与行为边界更清晰
OpenAI等厂商将规范融入大模型。上海交大等团队提出规范对齐概念,构建评测基准SpecBench,揭示主流模型不足。探索测试时深思方法,如Align3,能提升模型规范遵循度,项目已开源。
波士顿动力机器狗侧空翻炸场!穿轮滑鞋照样能翻
风头被中国机器人盖过的波士顿动力,让机器狗Spot完成侧空翻等动作。工程师称它并非为空翻设计。空翻是严苛测试手段,能验证系统性能,还透露了训练细节,此外它还将上《美国达人秀》。
GLM-5.2 正式发布:开源之王来了,摸到了Opus-4.8
GLM-5.2正式发布,主打长程任务能力,有1M token上下文窗口且完全开源。它在长程任务基准评测中表现出色,与顶级闭源模型差距缩小,还解决了超长上下文计算成本问题,同时应对了模型‘作弊’情况。
一站式 AI 短剧创作神器
Toonflow 是 HBAI-Ltd 开发并开源的一站式 AI 短剧创作工具,可将小说或剧本快速转化为动画短剧,集成多种功能,0 门槛全流程 AI 化,提升创作效率 10 倍+,支持多系统,兼顾易用性、扩展性和本地化部署需求。
这个免费的任务助手登顶 SuperCLUE-XClaw 榜单
近日,SuperCLUE - XClaw发布最新测评榜单,百度文心助手在十个参评的国产龙虾产品中夺冠,获97.62分。SuperCLUE是关注中文大模型评测的第三方体系,其榜单受业内关注。文心助手还是免费的。
3个工程师、0融资、不开会,估值3.5亿美元的Obsidian才是真正的「小而美」
Obsidian 作为全球最具影响力的本地化 Markdown 笔记应用之一,估值 3.5 亿美元,但仅 7 人全职团队。它拒绝资本,靠用户付费运营,有「无会议文化」,底层插件系统强大,和 Notion 信息管理哲学不同。