扩展原则」共找到 586 篇相关文章

产品应用8

6000 字,学不会退网!藏师傅Trickle AI保姆级Vibe Coding高级通关攻略

作者歸藏分享用 Trickle AI 做 AIGC 周刊信息聚合网站的教程,介绍开发方法,如提示词书写、Magic Canvas 功能、Edit 模式修改、数据库搭建、页面美化、加搜索功能及上线设置等,还指出开发范式迁移趋势并提建议。

歸藏的AI工具箱
算法论文7

少说‘Wait’,多做题:NoWait重塑大模型推理路径

现代大模型在复杂推理时爱用自我反思词,触发冗余验证循环,拖慢速度、增加算力消耗。NoWait方法零训练成本,通过抓关键词、扩展变体、实时屏蔽,让模型跳过废话,在多任务中表现出色,且颠覆对推理的认知。

深度学习自然语言处理
算法论文8

首次披露!DeepSeek V3 发布软硬一体协同训练论文,公开「降成本」秘诀

DeepSeek团队发布论文《洞察DeepSeek - V3:规模的挑战和对AI架构硬件的思考》,从硬件架构和模型设计双重视角,探索其经济高效的大规模训练和推理方法,介绍了设计原则、低精度驱动等多方面内容及降成本秘诀。

AI科技评论
算法论文8

Anthropic让AI先读员工手册再上岗:失控率从54%降到7%

Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率从54%降到7%。

新智元
算法论文8

LeCun在Meta的最后一篇论文

LeCun于11月11日提交最新论文《LeJEPA:无需启发式的可证明且可扩展的自监督学习》,当天其离职Meta消息曝光。论文提出LeJEPA自监督学习方法,解决表示崩溃问题,还回顾了JEPA架构发展,虽毁誉参半,但LeCun将继续推进世界模型工作。

量子位
推荐文章7

理解Ray Data分布式数据处理原理-源码分析

Ray Data是构建于Ray之上的分布式数据处理库,提供高性能且可扩展的API,可用于AI场景。文章从源码入手,分析其流式执行原理,包括读取数据源、构建数据处理、输出数据等环节,还介绍了LogicalPlan转PhysicalPlan及流式执行过程。

阿里云开发者
开源动态8

Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的

本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。

通义千问Qwen
产品应用8

构建会思考的测试Agent:从自动化到自主智能的演进

文章介绍面向企业级软件测试的质量数字人系统,结合大语言模型等实现从传统到自主智能测试跨越。分析专有云测试困境,指出通用AI Agent平台局限,阐述系统设计、能力及架构,展示应用成果并展望扩展场景与未来计划。

阿里云开发者
算法论文7

ICLR 2026 | 越推越快! 首个面向「Test-Time Scaling」的投机解码基准

文章指出推理阶段扩展(TTS)能提升推理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准,评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。

AI科技评论
算法论文8

SentGraph:一句一句把多跳RAG“画”成图

传统RAG在多跳场景易‘断链’,因检索单元太胖、逻辑关系乱。SentGraph把检索单元缩到句,按逻辑画三层图。线下建图分拆句、找关系、架桥梁;线上推理有Anchor初选、精炼及路径扩展。实验提升显著,也有局限。

PaperAgent