「深度主动优化」共找到 2044 篇相关文章
打破「数据暴力」预训练惯性,阿里Qwen、上交大等提出预训练动态数据选择范式OPUS
阿里Qwen、上交大等团队提出预训练动态数据选择范式OPUS,打破“数据暴力”预训练惯性。它将数据选择与优化器更新轨迹对齐,提升预训练效率与下游泛化表现,实验显示其“效率+性能”双提升。
微软31年老员工被裁,六旬老将重新踏上求职路
新智元报道,微软31年老员工Mike Kostersitz被裁。近年AI重组其所在部门,致他命运改写。过去两年硅谷盛行裁员,AI浪潮下,有经验的技术人员首当其冲,像他这样的中层正被系统优化。
无情淘汰PPT选手!美国AI创业圈,PhD才是敲门砖
在AI浪潮中,博士学位成取代MBA文凭,成创业者新宠。如今创业者凭科研深度引领革命,团队小而高效。AI创业者更年轻,名校光环仍重要,且AI初创能更快调整业务方向、实现收入规模化。
苹果出手!改进GRPO,让dLLM也能高效强化学习
苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。
飞书让表格变成「AI同事」加入群聊,不打开表就能用表
6月23日,Anthropic发布Claude Tag,让Agent进入Team Agent时代。飞书多维表格新功能「多维表格智能体」上线,思路类似,能让Agent成团队同事。它补齐权限和长期记忆,低门槛、可信,能主动工作。
AI不会自动带来好结果
马斯克称未来劳动力成本趋近零,人人高收入、工作成爱好。但AI是存量优化,不创造新岗位。其观点有致命漏洞,如生产红利分配不公、高收入资金来源不明、忽略工作社会意义等。
DeepSeek R1/V3作者开源轻量级vLLM,1200行代码读懂大模型推理技术!
DeepSeek R1/V3作者俞星凯开源轻量级vLLM——Nano - vLLM。它有快速离线推理、代码可读、含优化套件等特性,还给出了RTX 4070等硬件和Qwen3 - 0.6B模型的基准测试配置。
FlashAttention-4正式发布:算法流水线大改,矩阵乘法级速度
深度学习领域底层优化技术FlashAttention更新至4版本。其核心作者称在Blackwell GPU上,注意力机制执行速度接近矩阵乘法。新算法克服瓶颈,在B200上性能提升,还获Pytorch官方支持。
自建一个 Agent 很难吗?一语道破,万语难明
作者分享给传统研发平台接入 Agent 开发能力的经验,介绍技术选型、方案落地、系统提示词优化、知识库建设等内容,还提及工具接入、上下文管理等方面,为想自建 Agent 的人提供启发。
基于 Elasticsearch 创建企业 AI 搜索应用实践
Elastic 中国社区首席布道师刘晓国,分享基于 Elasticsearch 创建企业 AI 搜索应用实践,介绍其向量搜索技术及 RAG 应用开发,还提及智能时代搜索需求变化、混合搜索优势及 Elasticsearch 优化改进等内容。