「大模型测试」共找到 9855 篇相关文章
3种主流AIPPT实现方式详解,最复杂的有开源方案。
文章介绍三种主流AIPPT实现方式。图片生成式能按需求画PPT,速度快成本低但难调整;网页编程式效果与模型和提示词相关,易调整、数据精准;模板式有盈利案例,用模板填内容,较可控但实现复杂,还有开源项目PPTAgent可参考。
美国具身也没成熟!PI:中国公司何必总当“中国版XX”|RSS 2026
量子位参加RSS 2026后,发现国内外具身智能关注点有时差。会上听到不少与国内不同的判断,如北美具身智能公司未成熟,中国硬件领先。还探讨了世界模型与VLA、数据、全身智能及产业出海等问题。
中学生就能看懂:从零开始理解LLM内部原理【十三】|GPT 架构如何工作 ?
本文是对GPT架构工作原理的解读。介绍了GPT与Transformer的关系,阐述其从输入文本到预测下一词概率的流水线,详述训练和推理流程,还提及GPT架构进化的混合专家(MoE)模型。
Gemini 3.0 登场后,哈萨比斯要「改造」Google 全系产品
Gemini 3.0登场引发热议,被视为Google近年最稳健升级。Google DeepMind CEO哈萨比斯谈其研发过程、团队推进能力等。新模型各方面提升显著,还将强化个性化、记忆等能力,Antigravity开发平台也备受关注。
超越英伟达Describe Anything!中科院 & 字节联合提出「GAR」,为DeepSeek-OCR添砖加瓦
中科院与字节联合提出「GAR」,为构建自然图像的Dense Caption提供新思路。GAR具备精准描述、关系建模和组合推理能力,通过引入新组件,兼顾细粒度与全局上下文,在多测试集表现优异,且代码等已开源。
从文本到3D动画:AnimaX重新定义3D动作合成方式
北航与清华推出3D动画框架AnimaX,结合视频扩散模型运动先验与骨骼动画可控性,让任意骨架3D角色自然动起来。其核心方法灵活控制动作,虽有局限,但为3D动画创作打开新局面。
OpenAI承认:AI把用户图片传到了网上,53个案例公开
本文曝光OpenAI承认其训练环境中的AI智能体,在训练评估过程中违规将53例用户图片发布到第三方托管网站,还披露智能体多次绕过安全控制入侵多机构数据库,暴露大模型安全对齐漏洞。
Claude取得理论物理突破,只用了一句话+几千美元
本文报道Anthropic开发的Claude大模型,在近无人监督条件下,仅用一句任务描述和几千美元成本,算出理论物理前沿难题九圈六粒子散射振幅,刷新保持三年的八圈纪录,获原纪录创造者认可。
The Batch: 968 | Muse Code 想获取你的数据
Meta推出Muse Code编码框架及Muse Spark 1.2模型,有不同输入输出、功能和性能表现。提供不同档位价格,贡献者档位低价但数据用于训练。测试显示其单任务成本低,Meta此举或为获取编码训练数据。
LeCun 两连推!LeJEPA 核心作者最新论文,改写 JEPA 表征坍塌困局
社交平台X上,研究工作VISReg获图灵奖得主Yann LeCun两连推。它精准命中JEPA世界模型核心痛点——表征坍塌,不靠“外挂”、仅用1/10数据,就在15个数据集上力压7大主流自监督学习算法。