「长文本生成」共找到 2958 篇相关文章
鹅厂员工的“神之一手”代码都长什么样?
文章分享6位鹅厂同事的“神之一手”代码。有将快排浓缩到5行的Python代码,有解决逆序打印不可变链表的方案,还有修复订单状态同步漏洞、解决内存泄漏等代码,文末邀读者分享代码赢福利。
摆脱遥控器,波士顿动力人形机器人,开始「长脑子」干活了
世界人形机器人运动会引发对人工遥控机器人的争议。波士顿动力与丰田研究院合作为 Atlas 开发大型行为模型,展示其自主收纳整理成果,模型构建有流程,成果显著,研发遵循三项核心原则。
“一句话生成游戏”之后:2026 ChinaJoy的四个变化|甲子光年
AI给游戏产业带来新的生产技术,也引发了一场围绕游戏产业新价值链的争夺。本文介绍了2026 ChinaJoy现场正在发生的四个变化,包括游戏开发者的时间被重新分配、游戏引擎开始为Agent重新设计等。
跨本体、长任务、可预测……Motubrain双榜登顶只是一个开始
本文围绕具身机器人展开,指出当前大多具身机器人干活存在局限。Motubrain 双榜登顶,确立通用机器人大脑干活能力参照系,它具备一脑多能、一脑贯通等能力,生数科技已开启产品落地布局。
The Batch: 948 | GLM 5.1:面向长时任务的能力提升
Z.ai将旗舰开源权重大语言模型升级为GLM - 5.1,可在单个任务自主运行八小时。它专为编程和智能体任务设计,有推理等特性,在多榜单表现佳,但推理和数学能力落后闭源模型,价格有提升。
Life of a Token:像调试代码一样看懂大模型如何生成 Token
文章类比 Chrome 的 Life of a Pixel,追踪 LLM 里 token 从输入到输出的全程。以 GPT - 2 Small 为例,详细讲解其管线各阶段,如 Tokenization、Embedding 等,还介绍了残差流、KV Cache 等概念及 GPU 性能瓶颈和优化方法。
AI助手现在认路了:谷歌地图直接「长」进大脑
谷歌DeepMind为Gemini API更新,带来三大核心变化:内置工具和自定义函数可在同一次调用混用;新的「上下文环流」技术解决多步骤工作流丢上下文问题;Google Maps原生接入Gemini 3。这让Agent开发走向「工业化」。
Veo何止生成视频:DeepMind正在用它模拟整个机器人世界
通用型机器人策略发展带来挑战,传统评估方法有局限,前沿视频模型虽有潜力但面临困难。Google DeepMind团队提出基于Veo的机器人策略评估系统,经实验验证有效,展示了视频仿真评估的可行路径。
北大、字节、中科院自动化研究所等提出图像并行生成新范式
北大、字节等团队发现多模态模型先思考后作画会降低图像语义保真度,因自回归架构有误差传播问题。为此提出并行多模态扩散框架MMaDA - Parallel,构建ParaBench基准,多项优化后在测试中击败Bagel。
阿里Qwen3一大波更新:代码生成、视频、图片、语音全都有
阿里Qwen3迎来一大波更新,涵盖多个模型。如Qwen3-Max在代码与智能体表现卓越;Qwen3-VL是强大视觉语言模型;Qwen3-Omni是全模态模型;还有图像编辑、同传、安全防护等模型及旅行规划师等应用。