「Qwen3 - 0.6B」共找到 3344 篇相关文章
AI 创业者的反思:那些被忽略的「快」与「长」
周喆吾分享在 3D AR 社交平台 Presence 的创业反思,强调 AI 创业中‘快’和‘长 context’的重要性,还举例说明 AI 对白领工作的影响、Workflow Capture 做法等,指出产品经理和投资人应提升对模型的认知。
一招缓解LLM偏科!调整训练集组成,“秘方”在此 | 上交大&上海AI Lab等
上海交大和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当会加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。
阿里的 AI IDE 登场了,这事绝对有戏
阿里云正式发布通义灵码的AI原生IDE:Lingma IDE,免费开放,核心功能和Cursor对齐且速度更快。其整合Qwen、DeepSeek系列模型,有感知引擎等亮点,还有企业版适合国内公司。AI编程竞争激烈,阿里有机会做成。
首次,AI下棋不再是「黑盒」!
上海AI Lab发布升级版大模型「书生·思客InternThinker」,首度打破围棋AI推理黑盒,能用自然语言解释落子逻辑,具备职业3 - 5段棋力。依托创新训练平台InternBootcamp,它在多任务表现出色,且相关技术有系列创新突破。
9座新厂之外:台积电现存26 个Fab厂概况一览
台积电作为全球晶圆代工龙头,扩建步伐加快,今年将新建9座厂。本文盘点其现存26座晶圆厂区,涵盖6英寸、8英寸、12英寸晶圆厂及后端封测厂,介绍各厂位置、概况和最新情况。
180亿深圳芯片黑马,华为猛下单
4月25日晚,云天励飞公告2024年营收超9亿,同比增81.3%,截至4月28日收盘市值超180亿。该公司以‘算法芯片化’为基础,在推理算力、行业赋能、消费级业务均有布局,还与华为等合作。
n8n是开源工作流程自动化工具,提供直观界面创建自定义流程,支持超400应用集成。过去一年增长迅速,活跃用户超20万,ARR增长5倍,GitHub获77.5k star。介绍其创立背景、优势特点,用户评价褒贬不一,还提及与其他工具对比及“公平代码”理念。
Jev爆火硅谷!哑巴AI卷疯14万开发者
ChatGPT核心发明人Diogo Almeida离职OpenAI后推出不会生成文字的大模型Jev,发布3天就被主流平台集成,14万开发者涌入内测,提出行业旧路径跑偏,打造只做决策的新型AI,主打极速低成本零幻觉。
Apple 终于承认了:Mac mini 正在变成一台 Agent 服务器
苹果偷摸发布新 Mac mini,处理器升级到 M6 和 M5 Pro,官方将其置于 Agent 常驻使用场景,产品边界向 Agent 服务器延展。新款性能提升显著,Mac Studio 也有强大配置,Apple 产品线朝本地 AI 计算基础设施转变。
DeepSeek涨价,OpenAI降价,Agent改写了大模型价格战
近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。