大厂推虾苗」共找到 5546 篇相关文章

开源动态7

极客说|Unsloth 的全微调之路:从 Adapter 到 Full Fine-tuning

语言模型参数多,微调难。Unsloth 原靠支持 Adapter 微调出名,现支持全参数微调,单卡就能搞定规模模型训练。文章介绍其进化历程、关键技术、工程部署、使用优势及最佳实践。

AIGC开放社区
算法论文8

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链理。

量子位
产品应用7

RoboScience机器科学发布轮式仿人形机器人REX G1,打造新一代具身生产力伙伴

8月17日,RoboScience机器科学发布轮式仿人形通用操作机器人REX G1。它搭载自研VLOA架构通用具身模型Visics,面向多场景,能在真实世界完成任务闭环,具备多方面优势。

机器之心
新闻资讯7

撕开Claude Code真相:让它好用的98.4%,是工程不是AI

X用户文曝光Claude Code项目模板,实则是公开范式。研究显示Claude Code 98.4%是工程基建。OpenAI等团队已将AI编程跑成生产线,普通开发者也能搭建入门版基建。

新智元
开源动态8

谷歌出 LLM-Evalkit,为提示词工程带来秩序与可衡量性

谷歌出基于 Vertex AI SDK 的开源框架 LLM - Evalkit,让语言模型提示词工程更有序可衡量。它整合实验、测试等环节,与谷歌云工作流集成,有无代码界面,已在 GitHub 发布。

AI前线
算法论文8

社交Agent: 通过RL学习自适应Thinking,根据场景在“秒回”和“深思”间灵活切换

现有聊天机器人在人情世故场景表现不佳,论文指出模型思维‘一根筋’。研究团队设计4种思维模式,用AMPO强化学习算法动态切换。在模拟社交任务中,AMPO表现超GPT - 4,省时高效。

深度学习自然语言处理
新闻资讯7

刚刚,SpaceX、英伟达宣布:AI数据中心要上天了

SpaceX与英伟达合作设计Starmind AI1卫星计算载荷,每颗卫星搭载NVIDIA GPU和CPU,将数据中心算力部署太空,该设计也用于地面数据中心。但项目投入,还面临管理集群等难题。

机器之心
推荐文章8

如何正确Vibe Coding?这是来自Anthropic编程智能体负责人的师课

Anthropic研究员Erik Schluntz分享Vibe Coding经验。他认为AI能力指数级增长,开发者应接纳模型生成系统,还提出聚焦‘叶子节点’、做好产品经理等策略,并介绍22000行代码合并案例及实战问答。

机器之心
开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队出VTCBench基准测试评估模型视觉认知,含三任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元
产品应用7

以AI革新研发:从数字协同到智能工艺的全链路升级

文章介绍“数字化研发体系”,Geega捷做设计研发协同平台从三维度重塑研发管理,解决五问题;Geega工艺专家数智引擎系统让工艺环节智能化跃升,该体系能带来立体价值,提升企业效率。

AI科技大本营