自动评测体系」共找到 1694 篇相关文章

产品应用7

10万智能体同场模拟,YuLan-OneSim带来真正的大社会实验

YuLan-OneSim是大语言模型驱动的社会模拟器,能模拟人类社会行为。它可零代码构建场景,有50个默认场景,具分布式架构,支持10万智能体同场模拟,还推出AI社会研究员,自动完成社会科学研究流程。

带你学AI
产品应用7

我给剪辑产品 0 元雇了个外部研发部:它开始自进化

作者的剪辑产品有了“外部研发部”——Agent。它每天研究新方法、用真实项目测试。作者三步搭建此“研发部”,让其自动查询、测试和汇报,自己负责最终决策,项目获取新方法不再只靠偶然。

AI产品自由
开源动态8

具身智能“高考”难疯了!人类100分,最强模型12.8

原推出RoboTwin系列基准的团队带来RoboDojo,这是统一的仿真+真实世界机器人操作评测基准。它设42个仿真任务、18个真实任务,让30个主流策略竞技,结果显示机器人距通用操作差距大。

量子位
开源动态8

兼顾效率、成本与能力,百灵开源旗舰推理模型 Ring-2.6-1T

5月15日,蚂蚁百灵开源旗舰级推理模型Ring-2.6-1T,权重文件上线Hugging Face、ModelScope平台。该模型有万亿参数,‘按需思考’,在代理执行、推理机制、训练范式三方面升级,评测表现出色。

AI前线
7

DeepSeek急招Agent方向!一口气放17个岗位,重度Vibe Coding用户优先

DeepSeek一口气开放17个招聘岗位,核心聚焦Agent方向,覆盖算法研究、数据评测、基础设施等全链条。岗位要求显示其Agent布局从研究落地到能力建设,还追求数据闭环与技术栈全面布局。

量子位
推荐文章8

Claude Code 之父分享 10 大使用技巧

Claude Code 创造者 Boris Cherny 分享团队使用技巧,如并行工作、先规划再动手、更新 CLAUDE.md 等 10 条经验,还提及打造自动体系、提升 Prompt 水平等内容,强调多用多想提效。

AGI Hunt
开源动态8

Github 1.8k star Skyvern:AI直接接管鼠标键盘,3行API干掉你写了3年的脆弱XPath脚本!

Skyvern是开源AI浏览器代理,结合LLM和计算机视觉,自动执行浏览器业务流程。它用简单API复刻人工操作,替代传统脚本,解决脚本脆弱、流程复杂等痛点,功能丰富,技术优势明显,适合多业务场景。

小华同学ai
新闻资讯7

一键分享=全网公开?Claude 被曝聊天记录可在谷歌直接搜到

2026 年 7 月 26 日,Reddit 用户称用谷歌站点检索语法能调出 Claude 用户共享对话记录。因 Claude 未补全防护配置,致用户加密资产、身份等信息泄露。此前 OpenAI、Grok 也有同类问题,社区呼吁平台完善防护体系

AI科技评论
算法论文8

从答题到做实验:SciAgentGym让大模型进入科学工作流

复旦大学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。

机器之心
新闻资讯8

蚂蚁集团领投,光轮智能20亿美元估值引领全球具身数据基础设施|甲子光年

具身智能市场逻辑生变,从关注模型和本体转向数据与评测基础设施。光轮智能获蚂蚁集团领投,估值超20亿美元。其构建完整闭环,参与国际标准制定,打造物理AI教育系统,引领产业发展。

甲子光年