「自动化评估工具」共找到 2870 篇相关文章
OpenClaw Skill × DuckDB:一个会自动进化的电商销售分析预测是怎么炼成的
文章介绍 OpenClaw Skill 系统,给 AI 操作手册让其做事,还引入 DuckDB 解决大数据分析慢问题。以电商销售分析预测为例,展示两者结合实现自动化数据分析迭代闭环,使模型预测更准。
Seedance 2.0之后,又一中国视频模型SkyReels-V4登上全球第二
昆仑天工发布SkyReels V4视频大模型,在Artificial Analysis Arena基准测试中排全球第二。它支持多模态输入、音视频同步生成等,采用独特架构与技术,经多阶段训练,有全新评估基准,表现出色。
GitHub 19k star 写爬虫被封IP?Social Analyzer内置代理池,直接给你轮换出口,省去自己维护
Social Analyzer是开源OSINT工具,有API、命令行和Web应用,可在1000+社交媒体/网站分析查找同一人公开档案。它能降误报,助对付可疑账号,已获19k Stars,还被部分执法机构使用。
6款小游戏难倒所有顶级VLM!愤怒的小鸟让它们全军覆没,性能不如随机猜测
淘天集团未来生活实验室提出首个系统性评估多模态大模型(VLM)交互式物理推理能力的综合基准DeepPHY。它集成六个物理环境,对17个主流VLM测试,揭示其在物理交互等方面短板。
OpenAI:我们正朝着什么方向优化 ChatGPT?
OpenAI 官网文章称,ChatGPT 发展方向是成‘对你有用’的工具,不追逐 DAU 或让用户沉迷。它介绍了有用的使用场景,还提及健康使用方面的改进及与专家合作提升响应能力等内容。
The Batch:836 | 基准测试成本攀升
独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。
0.5B以小搏大拿下端侧模型新SOTA:4090可跑,长文本处理5倍常规加速丨清华&面壁开源
清华大学和面壁智能团队开源MiniCPM 4,有8B、0.5B两种参数规模,以22%训练开销达同级别最优。它在架构、推理、数据、训练多方面创新,性能领先,适用于综述生成、工具调用等场景。
惊讶!!!3.2 万 Star OpenViking,让你的原地起飞!!!
OpenViking有3.2万Star,它把记忆、文档、提示词等上下文统一成可浏览地址空间,设计三层信息按需加载,检索留轨迹,还接入多种工具。不过它处Alpha阶段,用前要考虑许可证。
Claude 或将推出 App Builder 功能,打造新的 App Store
Anthropic或为Claude推出App Builder功能,用户能从零构建全栈应用。此前Anthropic已从工具向平台转型,而OpenAI的GPT Store尝试失败,App Builder若成功,Claude将成新应用分发入口。
我写 nano banana pro 提示词时的原则和策略
作者分享写 nano banana pro 提示词的原则与策略,原则是做成模板、结合模型能力;策略是先跑通原型再抽象成模板;不过度精简提示词,还介绍用 GPT-5.1 等工具辅助。