「智能体指令集」共找到 3667 篇相关文章
告别“一眼定生死”:Agent-as-a-Judge 开启 AI 评估的下半场
过去两年,LLM-as-a-Judge成评估界“黄金标准”,但面对复杂任务力不从心。论文《A Survey on Agent-as-a-Judge》指出,应从单一的大模型裁判进化为具备行动能力的智能体裁判,还阐述了其优势、发展阶段等。
从过拟合到通用!ViMoGen开启3D人体动作生成新纪元
随着AIGC爆发,3D人体动作生成领域滞后,现有模型泛化能力有瓶颈。南洋理工大学等机构研究人员提出ViMoGen,从数据、模型、评估三方面重新定义通用动作生成路径,还能赋能具身智能。
OpenAI与Anthropic罕见合作:竞争对手联手测试AI安全
OpenAI和Anthropic完成联合评估,用内部工具测对方模型并公开结果。测试覆盖指令层级、越狱等四大领域,还发现不少细节和道德困境情况。此次合作意义重大,为行业树立安全合作先例。
汽车MCU的“芯”浪潮
在汽车产业变革下,汽车MCU作为核心控制部件迎来创新升级。AI浪潮让其算力狂飙,架构革新提升集成度,同时安全成新重点。未来,汽车MCU将更智能高效,融合AI、创新架构、重视安全。
印裔1号位删 Karpathy 团队90%代码、算力暴涨 50 倍!马斯克 Robotaxi 10年终上线,30 元乘车体验刷屏
当地时间6月22日,特斯拉在奥斯汀启动Robotaxi试点服务,仅受邀用户参与。其技术基于FSD 13.2.9微调,团队精简90%代码,算力强大。虽面临竞争,但马斯克看好其发展,认为2026年或现超级智能。
说句话就能飞!北航发布语言交互的无人机控制模型
北航刘偲教授团队提出语言引导的细粒度无人机轨迹控制研究框架,定义Flow范式。采用模仿学习法让无人机响应指令,构建数据集和仿真评测基准,还提出协作策略和算法,实现真机部署。
这场巅峰对话,把China AI的基因、堵点和未来聊透了|甲子光年
2025年4月28日,甲子光年大会巅峰对话探讨‘China AI如何重塑全球AI价值坐标系’。大模型、算力、具身智能、芯片领域嘉宾各抒己见,谈China AI基因、应对策略、行业堵点及未来判断。
我们对 Coding Agent 的评测,可能搞错了方向
用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。
AI落地的另一种可能性
Sam Altman用APP解决AI落地问题,如将ChatGPT打造成“超级APP”,但此模式有交互形态受限、生态割裂的缺点。作者认为这是权宜之计,并设想把AI作为“通用智能层”嵌入各行业软件,Anthropic有此可能。
首创“AI+真人”双保障模式!刚刚,百度健康推出7x24小时「能聊、有料、会管」AI管家
百度健康推出7x24小时AI管家,首创“AI+真人”双保障模式,提供全链路服务。它能精准咨询、推荐就医、管理健康档案,靠三层模型架构支撑,标志医疗AI向“智能健康伙伴”跃迁。