评测范式」共找到 1558 篇相关文章

算法论文8

超越人类标注,Meta提出CoT-Self-Instruct:如何用"推理式自进化"重塑LLM训练

大语言模型发展需海量高质量训练数据,传统人工标注困境重重,现有合成数据方法也有缺陷。Meta提出CoT - Self - Instruct,通过推理式自进化生成数据,实验证明其在多个任务上超越人类标注数据。

深度学习自然语言处理
算法论文8

首篇潜空间推理综述!模型思考不必依赖Token,带宽暴增2700+倍

史上首篇潜空间推理综述全面总结新兴推理范式,分析循环、递归等推理形式并总结成框架。潜空间推理用潜式思维链,带宽比显式CoT提升2700多倍,还介绍无限深度推理实现途径。

量子位
算法论文8

ICML 2025 | 多智能体的ChatGPT时刻?上交MAS-GPT实现工作流一键生成

上海交通大学等机构推出 MAS - GPT,提出生成式 MAS 设计范式,可一键生成可执行的 MAS。它解决了现有 MAS 方法无适应性、成本高、泛化性低等问题,实验显示其表现出色,未来潜力大。

机器之心
开源动态8

模型、代码、数据全开源!轻松训练自己的垂类Agent!

Together AI联合Agentica推出`DeepSWE-Preview`,基于开源Qwen模型,用RL在SWE - Bench - Verified登顶。团队将模型权重、训练框架等全开源,抛弃SFT纯用RL训练,还分享训练秘籍和TTS技巧,为垂类Agent训练提供新范本。

探索AGI
8

豆包 AI 编程:一句话写赛博鱼缸,动嘴皮改富士滤镜

豆包发布全新模型 1.6 后,AI 编程更新,基于此模型在评测集位列第一梯队。它实现低门槛+可用性,能一句话生成网站、工具,还可可视化编辑,目标是让普通人能做产品。

刘言飞语
产品应用7

测评豆包1.6:我用它开发了一个“聪明的旅行策划Agent”

作者对豆包1.6进行测评,用其构建旅行策划Agent。豆包1.6推理强、有自适应思考模式且计价创新。作者实操构建旅行Agent,结合MCP完成任务,虽有不足但超预期,国内Agent开发生态已成熟。

花叔
产品应用8

智能交互终于步入真·人机交互时代了,这很讯飞

科大讯飞发布会上展示智能硬件新范式,AIUI升级实现拟人自然对话,机器人超脑平台赋能机器人,还有数字人等成果。其交互技术不断突破,展示全链技术方案,推动产业升级。

量子位
新闻资讯8

每秒生成超30帧视频,支持实时交互!自回归视频生成新框架刷新生成效率

微软研究院与北大联合发布Next - Frame Diffusion (NFD)新框架,通过帧内并行采样、帧间自回归等方式,让视频生成在保持高质量的同时,效率大幅提升,还采用多项技术进一步优化。

量子位
开源动态8

全球首个历史基准!普林复旦打造AI历史助手,AI破圈人文学科

普林斯顿大学AI实验室与复旦大学历史学系联手推出全球首个历史领域评测基准HistBench及AI助手HistAgent。HistBench含414道题,能检验AI深度认知能力;HistAgent集成多种工具,在测试中表现优异。

新智元
新闻资讯8

Lex Fridman 对谈谷歌 CEO:追上进度后,谷歌接下来打算做什么?

Lex Fridman 采访谷歌 CEO Sundar Pichai,探讨谷歌在 AI 竞赛中的逆袭、搜索和广告的 AI 模式转变、模型发展、AI 编程提效、AR 前景、自动驾驶挑战等,还谈及 AGI 及 AI 对人类的影响。

Founder Park