「无数据训练」共找到 4427 篇相关文章
SGLang 的 DeepSeek-V4.1 Flash Day 0 优化实录:4×B300 上 BS=1 达到 764 tokens/s
本文是SGLang团队的DeepSeek-V4.1 Flash Day 0优化实录,详解了架构适配、KV cache压缩、kernel优化到DSpark适配全流程,公开4×B300 GPU实测吞吐数据,附复现代码与步骤
每周免费送1亿Token!扎克伯格押注王牌产品Muse:AI会24小时替你赚钱,我只负责抽成
本文整理科技记者对扎克伯格的播客访谈,扎克伯格公开反对AI技术被少数机构垄断,介绍了Meta全新推出的个人AI产品Muse的产品设计、商业模式与研发思路。
27岁研究员连辞OpenAI、Anthropic!两家都在拿我们的命下注
本文报道GPT-4o核心贡献者Jacob Coxon接连从OpenAI、Anthropic辞职并退出AI行业,批判头部AI机构陷入竞速赛,罔顾超级智能失控风险,直指行业需共同踩刹车。
T-RO综述重构Foundation Model时代机器人操作知识版图
近日,论文《Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives》被IEEE Transactions on Robotics接收,它以High - Level Planning和Low - Level Action Modeling为主线,梳理Foundation Model时代机器人操作发展,分析了现存问题及关键缺口。
陈大年复出,入局大模型
国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。
给Agent加上知识图谱,开源版Palantir
Semantica是LLM、向量库与Agent框架下的语义/上下文层,能把碎片化企业数据变成结构化、可查询的上下文图与知识图谱。介绍了其面向对象、功能、优势、使用方法、架构等内容。
不做手机缩小版:AI 健康记录迁到手腕,要跨过哪些工程鸿沟?
文章聚焦HarmonyOS穿戴应用,如「小卡健康」将健康记录入口移到手表,还介绍「开练」「凯格尔运动」应用。阐述了从接口到产品需解决权限、断连等问题,强调要为用户提供合适体验。
坚决不用行业标准AGENTS.md,Claude Code惹来“封杀令”:Anthropic终于回应了,但开发者更气了
当所有AI编程工具向行业标准靠拢时,Anthropic的Claude Code拒绝支持AGENTS.md格式,引发Shopify CEO公开威胁。开发者多次要求其支持该格式无果,Anthropic回应未让开发者满意,引发争议升级。
离开OpenAI和Google后,两位大模型核心负责人决定卷下一代架构
曾是OpenAI的「强化学习最大主义者」Jerry Tworek,与谷歌Gemini预训练负责人Rohan Anil,共同创办Core Automation。他们探讨当前AI路线问题,认为下一代架构要能持续学习,还计划打造自动化AI实验室。
李飞飞第一篇「触觉」论文:机器人会盲摸麻将了
李飞飞等全明星阵容关注灵巧手研究,提出T-Rex模型。其通过给触觉单独开通路等方式解决触觉加入难题,在真实任务中表现出色,还为灵巧手领域带来从机身分化、启发专用场景应用等变化。