「线下商业」共找到 1248 篇相关文章
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。
老黄自曝刚报废50亿美元显卡!亲自审查4.2万名员工薪酬,100%都加薪
黄仁勋在采访中透露报废50亿美元显卡,坚持先下单先得分配H100芯片。他亲自审查员工薪酬,称100%会加薪。认为AI是伟大“技术均衡器”,天价AI合同合理,还谈及芯片保值、中美AI竞赛等话题。
12.1万高难度数学题让模型性能大涨,覆盖FIMO/Putnam等顶级赛事难度,腾讯上海交大出品
腾讯AI Lab与上海交大团队联合推出首个基于自然语言的数学定理证明框架与数据集DeepTheorem。12.1万道高难度数学“特训题”让模型定理证明性能大涨,7B模型性能比肩或超越现有开源和商业模型。
英伟达:无敌是多么寂寞
北京时间5月29日凌晨,英伟达发布2026财年第一季度财报。收入440.6亿美元符合预期,毛利率60.5%低于预期,H20芯片计提存货减值影响大。数据中心和游戏业务表现佳,下季度指引体现市场对产品需求旺盛。
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。
MSRA首测AI从零建仓库:能写、能跑,但不一定对丨ACL'26
微软亚洲研究院工作RepoGenesis被ACL 2026高分录用,它是面向多语言、仓库级、端到端Web微服务生成的基准。输入贴近实际,用多维度评测开源Agent和商业IDE,还拓展模型微调。但也有边界,未模拟真实复杂需求。
两月蒸发1.6万亿:SaaS 被AI「杀死」了吗? | GAIR 025
今年初,北美软件股两月蒸发超1.6万亿美元,引发对SaaS未来的担忧。雷峰网圆桌中,何润、Daniel、吴昊三位行业老兵探讨现状与未来,认为AI冲击下,SaaS虽面临挑战,但不会被杀死,正全面转型。
终结数据荒!智源开源首个Deep Research数据合成框架InfoSeek
在大模型深度研究中,高质量数据是短板。近日,智源研究院发布首个面向深度研究的开源数据集InfoSeek,提出「扩散 - 回溯」数据合成方法,用3B模型在基准测试中接近商业模型表现,且数据集可扩容。
魔法原子迎来“春晚时刻”|甲子光年
2026年,魔法原子成春晚智能机器人战略合作伙伴,还举办全球合作伙伴大会。其自研机器人挑战春晚复杂环境,此前全栈自研积累实力,有超亿元订单,靠场景和生态赋能突围,未来需转化技术优势为商业成功。
从 IROS 2025谈起,智能机器人何时迎来「GPT式爆发」? | GAIR Live 019
雷峰网邀请三位嘉宾解码IROS 2025背后具身智能前沿趋势。探讨了IROS现场变化、具身智能认知升级、Sim2Real实用边界、商业落地路径等,还预测具身智能“GPT时刻”或由“World Model+VLA”组合推动。