「完全自训练」共找到 3139 篇相关文章
AI接管程序员!Anthropic创始人自曝行业末日时间表
Anthropic创始人Dario Amodei预测,AI三到六个月内或能编写90%代码,一年后可能编写所有代码。谷歌超25%代码已由AI生成。不过人类短期内仍在代码设计等方面重要,程序员要适应与AI协作。
完全免费!Claude Science开源平替,DeepSeek/GLM想用哪个用哪个
Anthropic发布面向科学家的AI工作平台Claude Science,能集成科研工具、多智能体协作等,但有系统、付费和模型使用限制。YC孵化团队推出开源平替OpenScience,不绑定模型厂商,功能更丰富且安装简单。
DeepSeek深夜更新后自曝:我是V4(?!)
DeepSeek网页端深夜大更新,推出「快速模式」和「专家模式」,还有「视觉模型」开启灰度测试。虽官方未说明,但网友推测专家模式可能是V4或V4 Lite,完整版V4或许不远。
美团之后,京东也开始自研大模型了
京东发布JoyAI - LLM Flash模型,激活参数小、推理快。它采用混合专家架构等技术,在基础架构、数据加工、强化学习等方面表现出色,还通过多Token预测等技术加速推理,为商业场景落地扫清障碍。
蒸馏出「乔布斯」之后,他说Apple AI完全是shit
文章用女娲.skill蒸馏出乔布斯等人物,借乔布斯之口评Apple AI,指出Siri弱在vision。还介绍女娲造出的8个skill,对比其与ChatGPT角色扮演的区别,说明可蒸馏不同对象及用途,最后展示蒸馏喜剧技巧写的吐槽段子。
上下文工程又进化了:Harness实现AI完全自主化
近期Harness Engineering讨论火热,Harness是围绕AI模型的支撑架构,Anthropic用其突破AI局限,解决AI完成复杂任务时的偷懒问题,还通过多智能体架构用于前端设计、软件开发,经实战检验效果良好,后续还对其进行简化。
刚刚,微软全新一代自研AI芯片Maia 200问世
微软原定于 2025 年发布的下一代 AI 芯片 Maia 200 问世。它基于台积电 3 纳米工艺,性能强、能效高,是异构 AI 基础设施重要部分,将为多个大模型提供支持,已部署在美国中部数据中心区域。
Andrej Karpathy爆料:自己家被Claude Code入侵了
Andrej Karpathy做实验让Claude Code入侵自家Lutron智能家居系统,成功接管全屋设备。此前网友用其控制烤箱等,引发连锁反应。但这也暴露物联网设备安全问题,还带来新威胁。
阿里、南开大学发布免训练,视频大模型创新压缩方法
视频模型序列化处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。
冲击自回归,扩散模型正在改写下一代通用模型范式
Google I/O 2025 开发者大会上,Gemini Diffusion 引发关注,它是采用扩散模型的语言模型。此前已有团队探索扩散式 LLM,如斯坦福、上海 AI 实验室等。蚂蚁集团和人大推出 LLaDA,后发展出多模态模型,国内团队跻身前列。