「评估工程」共找到 1392 篇相关文章
李飞飞LeCun疯狂加注!这匹中国黑马,已在因果AI暗战6年
世界模型成AI核心战场,背后是行业向因果科学转向。多数人2026年关注“因果”,中国零犀科技早在2020年就探索因果AI,自研因果大模型,搭建工程架构,将能力融入业务体系,提前布局优势凸显。
当 70% 的人将拥有智能体,谁来给 AI 建底座?澜舟科技周明:大模型落地的最后一道墙是“可信 AI”
4月16日澜舟科技春季沟通会,创始人周明分享智能体到数字员工演进等内容。指出AI进入落地新阶段,提出可信AI和智能体工程,展示相关技术体系、产品矩阵及行业方案,回答企业级AI现实问题。
RL Infra 行业全景:环境和 RLaaS 如何加速 RL 的 GPT-3 时刻
文章指出RL Scaling正推动AI从“人类数据时代”迈向“Agent体验时代”,RL Infra可弥合模拟与现实差距。梳理了RL环境、RLaaS、数据/评估三大模块,分析代表公司案例,探讨RL未来趋势与投资策略。
Claude Code凭什么牛?大模型团队天天用自家产品,发现bug直接就改了
Claude Code虽有争议,但很成功,4个月用户达11.5万。Claude Code负责人透露构建细节,如产品理念、评估标准、反馈机制等,还阐述编程领域变化、模型与工具共同进化等内容。
ICML 2025 | 大模型能在信息不完备的情况下问出正确的问题吗?
当前大语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估大模型主动推理能力,实验显示大模型主动推理能力严重不足,并指出后续拓展方向。
文档秒变演讲视频还带配音!开源Agent商业报告/学术论文接近人类水平
澳大利亚和英国多所高校团队提出多模态智能体PresentAgent,能将文档转化为配有语音讲解和同步幻灯片的视频演示。其模块化生成框架有可控性和领域适应性,评估显示它在各指标上接近人类水平。
AI 创业怎么做?500+ 技术领导者给出了他们正在实践的答案| TGO 杭州十周年庆 & GTLC 杭州站
2026年6月27日,TGO杭州十周年庆·GTLC全球科技领导力大会杭州站举办,近二十位嘉宾从多领域分享。如汪源指出智能体上下文工程是瓶颈,许式伟称AI是企业“外挂”等,还有创业者展示产品。
具身智能迎来ImageNet时刻:RoboChallenge开放首个大规模真机基准测试集
近日,RoboChallenge推出全球首个大规模、多任务真机基准测试。它构建开放、公正、可复现的‘真实考场’,为视觉 - 语言 - 动作模型提供评估标准,推动具身智能发展,还提供远程测试服务等。
吴恩达来信:AI 技能正在重新定义优秀开发者的标准
吴恩达指出市场对懂 AI 的开发者需求大,应届生失业率上升。面试看重利用 AI 辅助开发等能力,具备这些技能的人效率远超传统开发者,AI 工程正掀起变革,基础与 AI 知识结合造就高效开发者。
当 Kanban 不再管理人:Routa Kanban 如何管理 Agent Team
本文探讨了 Routa Kanban 如何管理 Agent Team,指出在 AI4SE 时代,多 Agent 协作进入日常软件交付需建设管理界面与工程护栏。Routa Kanban 把多 Agent 协作推进到‘管理驱动’,其价值在于将隐性约束显性化。