基准测试成本」共找到 3379 篇相关文章

算法论文7

一文解读 LLM Posting-Train技术

文章解读了大语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。

海边的拾遗者
开源动态8

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26

当前图像编辑模型处理三维状态常出错。浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导图像编辑,还加入深度监督,构建数据集和评测基准,成绩超Nano Banana Pro,且GUI也开源。

量子位
新闻资讯7

只会写代码没戏了!奥特曼最新面试题曝光:1人要干1个团队的活

OpenAI开年首场答疑会,奥特曼坐镇回应关切。他承认团队为追求ChatGPT编程能力,牺牲创意协作能力。还谈及软件工程未来变革、AI成本降低、Agent自主运行等问题,也对众多提问给出看法。

新智元
算法论文8

DeepMind再登Nature:AI Agent造出了最强RL算法!

Google DeepMind团队提出DiscoRL,让智能体在多环境交互中自主发现强化学习规则,无需人类设计。它在Atari基准中击败MuZero,在未见过的游戏中也稳定高效,相关研究登《Nature》。

新智元
新闻资讯7

被H-1B签证折磨10年,前微软科学家用AI「掀桌」

美国签证体系成本高、周期长、透明度低,前微软科学家Priyanka Kulkarni创办Casium,用AI改造签证服务,把材料准备时间大幅缩短,近期获500万美元种子轮融资。新规下,其服务更显重要。

新智元
开源动态8

国产开源LLM迎来大爆发的一周:Kimi、腾讯、快手、美团、面壁智能

国产开源大模型迎来爆发,快手、月之暗面、美团、面壁智能、腾讯等接连发布新模型,如快手Keye-VL - 1.5 - 8B刷新视频理解SOTA,美团LongCat - Flash - Chat推理快成本低等。

PaperAgent
新闻资讯8

马斯克首个编码模型上线,编程飙进Top5!这9位华人天团爆肝打造

xAI上线首个编码模型Grok Code Fast 1,速度快且性价比高,在编程基准测试中冲进前五。它全栈开发能力出色,背后核心团队华人学者占多半,xAI还给出提示词编写指南。

新智元
开源动态8

首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等

清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。

机器之心
新闻资讯7

27、42、73,DeepSeek这些大模型竟都喜欢这些数!为什么?

技术作家发现GPT - 4o、Claude等模型猜数偏好42、73,Andrej Karpathy测试中模型多选27。网友猜测原因,如数据集、人类偏见等,也有论文分析此现象,多与数据分布有关。

机器之心
推荐文章7

从案例分析到提示词写作,手把手教你制作最火爆的AI视频

文章教大家制作火爆的AI视频,介绍爆款分析、创意拓展、提示词生成等方法。用NotebookLM分析视频,Gemini拓展创意,还给出提示词模板。借助Veo3降低成本,最后完成视频生成、合并及后处理。

歸藏的AI工具箱