训练评估体系」共找到 3217 篇相关文章

算法论文8

脸谱心智陆弘远团队ACL 2026新作:别再给模型叠加「高级词」了!模型更爱听「大白话」

脸谱心智与香港中文大学科研人员中稿 ACL 2026 的新工作提出 Adam’s Law,即文本频率定律,揭示文本频率对模型训练及推理的重要性,还给出工程解法,实验效果显著,为行业带来新思路。

机器之心
新闻资讯8

高盛怕了!Claude Mythos全球首个攻破企业网络,奥本海默时刻来了

英国AI安全研究所研究显示,Anthropic发布的Claude Mythos Preview模型在网络安全评估中表现惊人,能全自动、全自主完成企业网络攻击模拟。高盛为此加强网络防御,人类网络安全或进入奥本海默时刻。

新智元
新闻资讯8

深圳SEO&GEO大会:搜索没死,只是竞争规则变了!

深圳SEO&GEO大会探讨搜索新形势,多位嘉宾分享见解。如Zac老师认为AI增长不代表搜索失价值,SEO应随搜索逻辑升级;Paul老师提出大品牌应将SEO目标转向争答案席位等。

白杨SEO优化教程
新闻资讯7

当AI进入物理世界:西门子科技大会要回答一个关键问题 | 甲子光年

2026年3月23 - 24日西门子将在北京举办科技大会,将系统呈现AI进入现实工业系统后的技术结构,探讨AI融入生产体系问题。大会还将举行多场活动,众多企业领袖将参与对谈。

甲子光年
产品应用8

比「小龙虾」更能打,中国AI视频大模型悄悄登顶全球第一

昆仑万维旗下 SkyReels-V4 Preview 版在权威评测平台超越 OpenAI、Google 等模型,登顶全球第一。它提升语义理解和逻辑能力,新增参考任务,还支持多语言短剧生成、视频编辑等,将在中关村论坛亮相。

机器之心
开源动态7

警惕!“养龙虾”风险,一键给你的Openclaw做安全体检

OpenClaw在短时间内登顶GitHub开源榜首,国内企业纷纷部署。但它存在安全隐患,如漏洞、隐私风险等。朱雀实验室联合腾讯云EdgeOne推出「OpenClaw安全体检」功能,可自动完成全面体检与风险评估

腾讯技术工程
算法论文8

YC总裁转发、登顶Hacker News:SkillsBench揭开Agent技能扩展的残酷真相

近日论文《SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks》引发海外AI社区关注。研究聚合47150个Skills,经严格筛选评估,揭示人工构建Skills效果好、AI自生成无效等核心发现,为AI研发指明路径。

机器之心
算法论文8

博士学位答辩PPT分享 | Scalable Operation-aware Aerodynamic Design

杨奥博博士毕业于香港科大,长期研究多学科优化方法在飞行器等设计中的应用。其博士论文提出可扩展的、基于任务感知的气动设计框架,贯通关键环节,形成一体化方法体系,有多项创新成果。

力学与人工智能
开源动态8

阶跃新模型快到“没推理”!印奇上任,果然气势一新

印奇上任后,阶跃星辰发布新一代开源Agent基座模型Step 3.5 Flash,总参数196B,支持256K上下文窗口。它推理快,适配多家芯片厂商,在多场景表现出色,还具备端云协同能力,架构也有多项优化。

量子位
开源动态8

机器人看不清,蚂蚁给治好了

天下苦机器人看不清透明和反光物体久矣,问题出在深度相机。蚂蚁集团具身智能公司蚂蚁灵波开源深度视觉模型LingBot - Depth,无需换硬件,用创新算法和大量数据提升性能,还将开源数据集。

量子位