Llama-3.2-1B」共找到 3534 篇相关文章

算法论文7

一招缓解LLM偏科!调整训练集组成,“秘方”在此 | 上交大&上海AI Lab等

上海交大和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当会加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。

量子位
新闻资讯7

9座新厂之外:台积电现存26 个Fab厂概况一览

台积电作为全球晶圆代工龙头,扩建步伐加快,今年将新建9座厂。本文盘点其现存26座晶圆厂区,涵盖6英寸、8英寸、12英寸晶圆厂及后端封测厂,介绍各厂位置、概况和最新情况。

芯师爷
产品应用8

AI编程冲刺“DeepSeek时刻”:00后团队用国产模型一键直出复杂应用,效果超越Claude Code

云端Agent有新进展,重新定义AI编程范式。Vinsoo上新Beta 3.0版本,仅用国产大模型就超越一众流行AI编程产品。它解决了4个核心技术问题,还带来三重云端AI Agent新体验,其研发团队由00后主导。

量子位
推荐文章8

八年孤独,Iceberg 赢得世界

本文讲述 Iceberg 的发展历程、技术特性、用户案例及商业生态。它从解决 Hive 痛点孵化,经开发者、客户、厂商推动成开放表格式标准。其 V3 Spec 补充短板,社区开始构想 V4 。诸多科技大厂深度使用并贡献代码。

InfoQ
新闻资讯8

Agent 原生开发时代到来,Google Cloud Next 26 给开发者带来了什么

Google Cloud Next 26 大会热度高涨,反映行业对 Agent 原生时代的关注。Google Cloud 展示了云产业从 Cloud Native 到 Agent Native 的三层同步转换,还推出一系列 Agent 开发和管理套件,解决开发者关键问题。此外,大会亮点 A2UI 解决交互层 Agent 化。

AI科技大本营
新闻资讯7

字节阿里DeepSeek决战春节:一场关乎14亿人的重磅AI大战

春节将至,字节、阿里和DeepSeek间的AI大战拉开帷幕。字节将推三款多模态旗舰模型;阿里或发布Qwen 3.5,让千问打通支付与电商;DeepSeek V4或携强代码能力突袭。这是对用户生活入口和互联网秩序的争夺。

新智元
产品应用8

救命!和漫画角色聊上头了,AI陪伴的新答案有了

快看漫画2.0版本推出AI陪伴互动漫画,将AI嵌入漫画角色,玩家以第一视角改写故事。它解决了AI陪伴产品痛点,靠共同经历和叙事上下文存续关系,还集成多家AI技术,内测数据显示有商业潜力。

量子位
新闻资讯7

谷歌卷土重来:你大爷还是你大爷

上周谷歌横扫科技媒体头条,传闻Meta考虑换谷歌TPU致英伟达市值蒸发,过去一月其缩水6000亿,谷歌涨5000亿。此前被看衰的谷歌,发布Gemini - 3及三季报后强势回归,TPU外供挑战英伟达地位。

远川科技评论
新闻资讯8

马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1

当谷歌Gemini 3将上线消息传得沸沸扬扬时,马斯克xAI更快一步上线最新大模型Grok 4.1,响应速率提升、幻觉率下降。它有两个“形态”,免费开放且有APP版。在LMArena测试中成绩亮眼,多方面能力提升。

AI前线
产品应用8

LLM 技术在有道词典笔上的应用实践

本文围绕LLM技术在有道词典笔的应用展开。先分析端侧大模型落地挑战,如算力、功耗等。介绍有道词典笔等硬件及应用,对比端侧与云侧AI优劣。还阐述模型落地模式、算法优化及“子曰3数学模型”开源情况。

InfoQ