「AI模型训练」共找到 13660 篇相关文章
AI5芯片搞定,马斯克的纯自研超算Dojo 3又回来了
马斯克宣布AI5芯片设计进展顺利,特斯拉将重启Dojo 3工作。Dojo项目定位为面向机器学习训练的超算,此前曾暂停。如今Dojo 3将集成AI5或AI6芯片,有望助力特斯拉摆脱对英伟达依赖,自建算力体系。
数学奥赛高分摘金,位列大模型榜首,『书生』科学多模态大模型Intern-S1能力再升级 | 通专融合新进展
2025年CMO决赛首设AI测试,书生科学多模态大模型Intern-S1以102分位列大模型得分榜首,远超金牌线和国家集训队入选线。其推理能力提升得益于多项创新,未来将拓展至多领域科研。
AI不会减少工程师!Reddit疯抢应届生:“AI原生一代”必须毕业就招走
Reddit联合创始人兼CEO Steve Huffman表示,公司会大量招聘应届生,尤其是工程类岗位,认为AI不会减少工程师数量。他还复盘Reddit IPO成功原因,阐释平台在AI时代的不可替代性,强调社区真实性的重要性。
阿里的 AI IDE 登场了,这事绝对有戏
阿里云正式发布通义灵码的AI原生IDE:Lingma IDE,免费开放,核心功能和Cursor对齐且速度更快。其整合Qwen、DeepSeek系列模型,有感知引擎等亮点,还有企业版适合国内公司。AI编程竞争激烈,阿里有机会做成。
上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体
上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。
不止Deep,更要Wide:清华、无问芯穹发布多智能体系统WideSeek-R1,4B模型比肩671B模型!
清华与无问芯穹的RLinf团队提出「广度扩展」,发布多智能体系统WideSeek-R1。它采用「Lead-agent-Subagent」框架,经MARL端到端训练,4B模型在广度搜索任务表现比肩671B模型,且在标准QA任务也出色。
DeepSeek流量暴跌?AI大模型全球霸主离奇遇冷,外媒曝出真相
曾以低价高性能出圈的DeepSeek,在自家平台遇冷、市场份额下滑,但其R1和V3模型在第三方平台使用量增长近20倍。背后是‘Token经济学’及战略转移,它开源模型,将算力留作研发。Anthropic也因算力受限有类似问题。
AI「第二章」开启,未来看应用与Agent!
文章基于对一线投资机构访谈,指出AI开启新篇章,模型投资降温,应用时代来临。还探讨DeepSeek与Manus影响、Agent发展路径、AI原生硬件等多领域现状与趋势,为创业者和投资人提供参考。
AI助手Cici悄然霸榜海外,又是字节
AI智能助手领域有新玩家,字节跳动的Cici在多个国家应用商店霸榜,数月内下载量爆发式增长。它融合字节旗下技术,文本生成用到OpenAI、谷歌模型。同时,豆包在国内AI智能助手赛道全维度领先。
Anthropic让AI先读员工手册再上岗:失控率从54%降到7%
Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率从54%降到7%。