「训练体系」共找到 2697 篇相关文章
一个模型超了DeepSeek R1、V3,参数671B,成本不到350万美元
Deep Cogito 是旧金山 AI 初创公司,开源四款混合推理模型。最大 671B MoE 模型性能超 DeepSeek v3 等,推理链比 DeepSeek R1 短 60%,训练成本不到 350 万美元。核心方法是迭代蒸馏与增强。
0 融资、10 亿美元营收,数据标注领域真正的巨头,不认为合成数据是未来
Surge AI创始人Edwin Chen接受访谈,提出创业应解决问题而非融资,合成数据被高估,高质量数据才是壁垒。他还指出大语言模型竞技场误导训练方向,人类反馈永不过时,数据质量是AI发展首要瓶颈。
拥有Github 的微软终于出手,发布一键生成全栈应用的GitHub Spark!
微软发布GitHub Spark,能以自然语言生成全栈应用并一键部署,默认用Claude Sonnet 4。它遵循微应用理念,有强大功能体系,深度集成GitHub。开发者看法不一,目前向Copilot Pro+用户开放,或改变市场格局。
智能PPT生成系统
MultiAgentPPT是基于A2A + MCP + ADK的多智能体系统,能流式并发生成高质量PPT。它通过多智能体协作,从大纲生成到内容汇总,提高效率与准确性,还介绍了使用界面、项目结构、快速开始步骤等。
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
AI操作有了“紧急刹车”!通义&自动化所AI决策诊断模型,GUI智能体纠错正确率SOTA
阿里通义实验室与中科院自动化所推出GUI - Critic - R1模型,能在GUI智能体操作执行前诊断决策,避免错误。介绍了其动机、方法、数据集及实验,证明该模型在生成判断和提建议方面有效。
103K「硬核」题,让大模型突破数学推理瓶颈
现有大语言模型在数学推理训练时面临数据瓶颈,腾讯AI Lab与上海交大团队推出DeepMath - 103K数据集。它规模大、难度高、数据新颖、严格去污染,让DeepMath系列模型达SOTA,还能实现推理泛化。
从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench
港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。
全球首个AI智能体「自进化」开源框架来了!一次部署,终生可用
英国格拉斯哥大学团队发布全球首个AI智能体自进化开源框架EvoAgentX,打破传统多智能体系统构建与优化限制。它有自动化构建、自进化机制和系统性评估亮点,实验验证其性能提升显著。
刚刚,北大校友Lilian Weng自曝公司首个产品?一篇论文未发,估值却已90亿
OpenAI前安全副总裁Lilian Weng疑似曝光90亿估值新公司Thinking Machines首个产品——手动调参仪表盘,训练中可手动调超参数。OpenAI也有AI硬件野心,设想让ChatGPT成全能硬件助手。