「性别差距」共找到 257 篇相关文章
世界模型评测的最大盲区,被这个新基准捅破了
过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。
GLM-5深夜登场,这是国产开源模型首次逼平Claude Opus 4.5。
GLM - 5深夜发布且开源,参数量从355B扩展到744B,跑分仅次于顶级模型,开源排第1。能力逼近Claude Opus 4.5,BrowseComp基准得分超普通GPT - 5.2。价格便宜,是国内可用且性价比高的大模型。
中国顶尖科学家数量已超越美国
中国科研正从跟跑变领跑,国际合作领衔比例上升,与美欧渐趋均衡。人工智能等关键赛道加速发展,顶刊与高被引成果、顶尖人才增多。借‘一带一路’放大影响力,重绘全球科技版图。
刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3
互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。
印度国家级大模型上线两天仅 300 余次下载,投资人直呼“尴尬”:韩国大学生模型都有20万!
印度 Sarvam AI 发布国家级模型 Sarvam - M,虽被赞为本土 AI 研究突破,支持 10 种印度本地语言,但上线两天仅 334 次下载,投资人批评其成果‘令人尴尬’,引发社区激烈争论。
李飞飞团队发布新一代世界模型Atlas:从零训练,一次性打通视频生成、 3D重建与机器人仿真
李飞飞创办的 World Labs 发布新一代世界模型 Atlas,称其为‘全球首个多模态世界模型’。它从零训练,能同时完成视频生成、3D 重建和时空模拟,已向少数伙伴开放测试,未来将成 Marble 底层模型。
别高估车企“造人”
今年5月特斯拉停产后搭建Optimus量产线,虽强调FSD算法可复用,却未量产。车企造机器人,优势在供应链管理和生产制造,算法移植效果一般,且面临数据难题,竞赛中暂无通关密码。
Auto-Research「终极大考」:新基准撕下大模型科研伪装
来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。
设计圈的 Claude Code 时刻来了
Anthropic发布Claude Design,震惊程度堪比当年Claude Code。它由Claude Opus 4.7驱动,界面简单,与传统设计工具不同,AI为主生成者,人为主审阅者。能覆盖多类工作,对各角色影响大,虽有局限但未来可期。
1美元Token撬动4800美元收益!AI挑战百万美元级基准,最赚钱的Agent出现了
Humanlaya Data Lab等机构构建$OneMillion - Bench评测基准,用经济价值衡量模型。它含400道高难题目,覆盖多领域。目前最强模型能产出约50万美元价值,但离可交付专业任务还有距离。