「评估工具」共找到 2523 篇相关文章
港科广等发布首个医学世界模型!精准模拟肿瘤演化,规划治疗方案
医学世界模型(MeWM)是创新AI系统,能模拟疾病演变、预测肿瘤变化,助医生术前评估治疗效果、优化方案。港科广等团队提出该模型,有肿瘤演变模拟等三核心贡献,在多方面实验表现佳。
实测 MiniMax H3:开源“斩杀线”蔓延到视频模型圈
本文实测 MiniMax H3 视频模型,它 8 月 3 日开源,成本低至 0.5 元/秒,在编辑榜成绩佳。它定位全模态生成,能多素材输入。实测效果好,价格约为 Seedance 2.5 的三分之一,还支持原生剪辑,适配多芯片与工具。
刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜
Anthropic发布Claude Sonnet 5,称其为最具Agent属性的Sonnet模型。它在推理等方面性能提升,接近Opus 4.8且价格低。安全评估有改善,但网络安全逊于Opus 4.8。已正式可用,有优惠首发价。
Google开源DESIGN.md。玩AI,今年最该知道的Markdown!
Google开源DESIGN.md格式规范,对用AI coding的人很实用,可约束产品UI设计。开源社区已有70+大厂的DESIGN.md及自动提取的开源项目。还有汇聚大厂设计规范的仓库及可自动生成的工具,或成行业标准。
前端裁员黑科技!PinMe把部署从运维清单划掉,DevOps团队专注业务
PinMe是「一条命令就能部署前端」的命令行工具,在GitHub获约1k Star。它能将静态站点上传到IPFS,写入ENS子域名的contenthash,通过网关访问,无需自搭服务器和配置传统DNS,适合Web3前端部署。
Github 3.6k star,爆火开源「小红书 MCP」:一键登录、图文发布、搜索、评论全搞定
`xiaohongshu-mcp`把浏览器手工步骤封装成可编排工具,以Go编写,能在无头/有界面模式间切换。它解决小红书运营多痛点,如登录不稳、发帖链路长等,覆盖登录、发帖等全链路,适配多客户端,值得收藏上手。
离谱,偶然发现一个逆天MCP...
作者偶然发现滴滴入局打车MCP,用其接入苹果打造能通过Siri用嘴打车的Agent。介绍了将滴滴MCP接入Claude Code、Fastgpt、n8n等工具的过程,还分享用Siri实现嘴打车的流程,认为其填补AI打车空白。
为什么 Agent Memory需要 AML:看 AML “变量控制”的工程设计
传统 Agent 记忆评测有水分,近日放榜的 Agent Memory Leaderboard (AML) 通过严格控制变量构建盲测管线。文章从技术架构深拆其工程细节,还分析了首期榜单,指出其重构评估变量的价值。
Fable 5解禁即翻车!写一行代码就降智,开发者破防
消失19天的Fable 5解禁即翻车,因过度审查和双标机制,让开发者破防。但抛开护栏,它执行复杂任务能力强。A社同期发布的Sonnet 5也遭群嘲,此外,A社还提出评估框架并向政府让步。
AI编程真面目:完整项目通过率仅27% | 上交大新基准
多校联合团队发布ProjDevBench,评估AI编程智能体端到端项目开发能力。结果显示,六种主流智能体总体提交AC率仅27.38%,从零构建任务中性能大幅下滑,还揭示了智能体多方面短板。