结构化评估」共找到 1780 篇相关文章

推荐文章8

Agent开始“自我进”:会出题、会反思,还会自己长出新技能

文章围绕自进Agent展开,介绍其概念、受重视原因及三大技术路线,涵盖各路线代表工作的特点、评估及对比,指出研究空白如总结者训练等,最后还介绍了基于Agentic AI的全链路数据助手Dola。

腾讯技术工程
开源动态7

Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。

InfoQ
新闻资讯8

全球AI新王诞生!Anthropic估值冲爆1.2万亿,首次反超OpenAI

Anthropic估值达1.2万亿美元反超OpenAI,若上市将成全球第11大上市公司。其年收入和使用量一季度同比增80倍,获马斯克22万张GPU及谷歌2000亿美元云服务协议,但维持高估值面临挑战。

新智元
新闻资讯7

独家|RoboScience 机器科学完成10亿元融资,资金将用于强 VLOA 大模型与本体

AI科技评论独家消息,RoboScience机器科学近日完成10亿元A轮融资,将深VLOA大模型技术,推进自研机器人本体工程与量产。其VLOA大模型有创新性架构,能实现通用泛,还将发布自研机器人本体。

AI科技评论
算法论文8

头号玩家照进现实!NTU发布世界模型交互新范式,攻克主动操作难题

南洋理工大学MMLab团队推出Hand2World,让AI世界模型能真正互动。它摒弃旧有遮挡误导,用3D手部结构与射线编码解耦手与头运动,实现闭环持续交互,基于单目视频全自动标注,为AR、机器人交互铺路。

新智元
推荐文章8

/phodal-writer:如何把十年写作经验整理成一个 Skill

作者Phodal分享将十年写作经验整理成写作Skill的过程。指出用AI写作输出不稳定,问题在于未将写作决策工程。经样本整理、模式提取、规则改写等步骤,形成可复用的写作系统,强调其可放大经验可迁移性。

phodal
新闻资讯7

Sora关停背后:为啥它没跑成“视频版ChatGPT”?

OpenAI Sora 宣布关停,评论区评价两极分。其未成为“视频版 ChatGPT”,主要因踩中生成式 AI 最难的三件事:使用频率、成本结构和产品形态。关停或与 OpenAI 筹备 IPO 有关,未来 Sora 团队将推进世界模拟研究。

AI前线
推荐文章7

当每个人都能指挥一支 AI 大军,什么能力最重要?

文章指出,在AI Agent增多的时代,管理能力是驾驭它们的关键。沃顿商学院教授提出判断是否委派任务给AI的公式,还建议从更好的指令、评估、反馈三方面提高成功率,同时给出委托任务和锻炼管理能力的方法。

宝玉AI
新闻资讯8

新瓶旧酒or涅槃重生?操作系统的 AI 进终将走向何方?

本文基于「AI 进论:智算时代 OS 的破局之路」直播实录,解码 AI 时代 OS 破局之道。探讨国内外 OS 的 AI 进差异、内核价值重构、技术跃迁、算力适配等,还提及未来趋势、Agent 生态挑战及 OS 进关键。

InfoQ
开源动态8

马斯克兑现承诺,开源X推荐算法!100% AI驱动,0人工规则

1月11日马斯克宣布7天内开源X平台推荐算法,如今承诺兑现。新算法由Grok驱动,全AI,移除人工规则。它双引擎驱动信息流、15种行为预测打分,还揭示过滤机制与设计理念,为创作者提供曝光建议。

新智元