「元评估」共找到 1364 篇相关文章
大模型开网店,谁是经营高手?E-Commerce Bench开源揭秘
为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。
帕西尼再融10亿元,具身感知赛道跑出35亿元融资纪录
帕西尼获10亿元战略轮融资,累计35亿领跑全球具身感知赛道。本轮由巨头和基金联合领投,形成“四位一体”资本生态。其全栈自研,具先发优势,正推动具身智能发展,目标成产业能力底座。
不到一年ARR破亿元,GEO厂商智推时代获数千万元天使轮融资 | 甲子光年
近日,AI营销科技公司智推时代完成数千万元天使轮融资,将用于技术研发等。其成立一年多 ARR 破亿,服务近 400 家头部客户。自研 GENO 系统,与华东师大共建实验室,还布局全球市场。
独家丨擎天租完成A轮及A+轮数亿元融资,估值达70亿元,具身赛道再添独角兽
AI 科技评论独家获悉,擎天租完成 A 轮及 A+ 轮数亿元融资,估值达 70 亿成独角兽。其定位 RaaS 平台,将业务重心推向产业场景,本轮融资用于体系建设和场景拓展。
理想首款AI眼镜,只卖1699元
理想推出首款AI眼镜Livis,售价1699元起,整备重仅36g,续航18小时。它能控车、有头枕音响,还可拍照录像。采用流式智能语音框架,核心亮点是理想同学语音助手,意在构建以车为核心的AI生态。
OpenAI神秘项目曝光:cderGPT,用AI加速药物评估
OpenAI神秘项目cderGPT曝光,用于加速药物评估。FDA局长指出新药上市耗时长且未实现技术现代化,不过目前该项目细节未透露,有人支持用AI辅助审查,也有人担心其可靠性。
49.8亿元,寒武纪定增申请获受理
6月4日晚,寒武纪49.8亿元定增申请获上交所受理,这是其上市五年内第二次定增且金额最大。公司业绩增长,董事长陈天石介绍发展规划,定增或与AI浪潮有关,资金用于芯片和软件平台等项目。
ACL 2026 | 腾讯混元Agents工具学习新范式
腾讯混元团队在 ACL 2026 Findings 发布的 ToolCPT 指出,Agent 用不好工具病根在预训练。它从真实代码挖工具,写说明书,融入预训练,实验显示能有效提升工具运用能力,但也有局限和成本。
混元 Hy3 发布:99% 的任务,够用了
腾讯混元模型 Hy3 正式上线,免费使用两周。它是快慢思考融合的 MoE 模型,主打 Coding 和 Agent 场景,性价比高。作者用它做了多项测试,如制作 PPT、开发代码、舆情分析等,还与 GLM - 5.1 对决,表现不错。