「基准数据集」共找到 3297 篇相关文章
14万,家务机器人带回家!斯坦福华人博士具身创业首款产品亮相
斯坦福明星华人博士生创业机器人Memo亮相,售价2万美刀。它颜值高,能做家务,在无剪辑等的demo中有出色表现。其背后是ACT - 1模型,依赖技能捕捉手套数据训练,成本低且用户可教它新本领,预计2026年推出。
AI训练初创公司Mercor,年运收入4.5亿美元,冲击100亿美元估值
AI训练初创公司Mercor正洽谈C轮融资,目标估值100亿美元或更高。它为OpenAI等对接专家,还提供数据标注服务,年化运营收入近4.5亿美元,但也面临Surge AI等对手竞争,OpenAI新平台或带来新威胁。
长文本推理 5 倍提速!面壁MiniCPM4 端侧模型发布,0.5B模型效果秒杀同级
近日,面壁发布 MiniCPM4.0 端侧模型,有 8B、0.5B 两种规模。其在基准测试表现出色,长文本推理提速,缓存锐减,还做了架构创新。此外,面壁有自研推理框架,科学化建模产线,6 月 27 - 28 日 AICon 北京站将探讨 AI 趋势。
MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B
微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。
LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?
论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。
阿里自己上场,用Qwen3做起了SmartResume应用
近期,阿里用Qwen3-0.6B+YOLOv10做了智能简历解析系统SmartResume,Code、Model、Paper都已开源。该系统支持多种文档格式,融合OCR与PDF元数据完成文本提取,结合版面检测重建阅读顺序,并通过LLM将内容转换为结构化字段。
OpenAI单月收入突破10亿美元!算力严重不足,急需“星际之门”
OpenAI首席财务官Sarah Friar透露7月单月收入破10亿美元,因GPT - 5发布和新订阅服务,算力压力大,所以联合投资打造“星际之门”。虽GPT - 5有争议,但订阅用户增长,开发者反馈好。
为什么GPT-5算得出微积分,却数不清积木?
文章对GPT - 5展开系统化空间能力测评,涵盖8个基准、超10亿token成本。提出“空间智能六维图谱”,发现GPT - 5在MM和SR达人类水平,但MR、PT等方面有短板,还揭示闭源与开源模型在复杂任务上差距小等情况。
AI一天写4.4万行代码却没合并,程序员:AI Coding 真正的瓶颈来了
本文分享腾讯AI原生研发的真实案例,指出AI Coding产能提升后,最大瓶颈已非模型能力,而是现有研发治理体系与人的注意力适配问题,同时预告2026奇点智能技术大会的行业实践分享。
当 Agent 走出 App:WorkBuddy 的朋友圈开始向外生长
9月2日深圳的WorkBuddy生态发布会,展示9款联名硬件,有30多个硬件品牌、30多个Buddy应用、100多个开放平台共创伙伴参与。WorkBuddy开放Agent能力,连接伙伴资源,解决数据和专业经验难题,开放硬件、应用与平台三层,但面临价值分配等问题。