「训练导向问题」共找到 4896 篇相关文章
追忆左耳朵耗子
本文追忆技术人左耳朵耗子,讲述其创业故事,包括创业契机、方向选择等,还分享技术见解,如选技术语言、积累技术等,探讨成长问题,如996、大小公司权衡等,最后推荐书籍并谈对年龄危机看法。
首个时空时序推理框架:让大模型真正读懂时空数据 | ACL'26
STReasoner是首个结合时间序列、空间结构和自然语言的推理模型,能识别异常源、追踪影响路径。研究团队构建数据生成框架和评测基准,采用三阶段训练策略,模型在多任务表现优,成本低且泛化能力强。
AI越强,企业越迷茫:顶尖CIO们的十大真实之问
阿里云CIO与40余家头部企业CXO深度碰撞,总结出《企业智变下的CIO集体之问》。报告指出企业AI落地困境,如数字人认知混沌、知识库建设难等,探讨十大经典问题,为企业提供思考方向。
用 AI Coding 工具生成 60 万字奇幻世界设定的实践记录
作者先尝试用 Python/C# 编排 LLM 调用生成小说世界设定,遇节点信息查看、输出形态等问题。后用 AI Coding CLI,经搭建骨架、基础层展开等阶段生成 60 万字奇幻世界设定,还基于此创作叙事。
OpenClaw 深度解析:一只龙虾凭什么震撼全世界
万字长文深度解析OpenClaw,阐述其核心原理、创新亮点以及对AI行业的深远影响。解读为何大厂难以打造类似产品,剖析简单任务实现困难的根源,还探讨了其设计机制、应用场景、潜在问题及应对策略。
Agent 2.0时代来了,首批「工业级智能体」正在核心位置上岗
近日科技圈感叹AI工具提升效率,谷歌工程师分享使用智能体经历。1月7日阿里云百炼全面升级,开启智能体‘工业化流水线’时代,解决技术落地问题,发布企业版,推动人机协同时代到来。
长上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破
月之暗面团队的Kimi Linear模型,是混合线性注意力架构,核心是Kimi Delta Attention模块。它解决线性注意力的记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效长上下文模型研究。
清华首提通用大模型滤波方法,实现零样本状态估计|NeurIPS'25
清华大学李升波教授团队在NeurIPS 2025提出LLM - Filter通用滤波器,将状态估计融入大语言模型推理框架。它能解决传统方法泛化性差问题,在未见过系统中实现零样本状态估计,有望成基础模型。
Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana
北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。
让LLM扔块石头,它居然造了个投石机
港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。