3B参数模型」共找到 8504 篇相关文章

算法论文8

ParScale:一种全新的大模型Scaling Law

文章提出并行扩展(ParScale)路线,在不增模型参数下,通过引入并行流提升性能。新扩展定律打破传统范式,两阶段后训练策略降成本,还适用于边缘设备,研究仍在进行。

通义千问Qwen
开源动态8

AI操作网页:browser-use和AI大模型互动解析

文章深入解析开源框架browser - use与AI大模型互动方式。它能自动化在线任务,靠精巧prompt设计和不同类型Message输入实现高效交互,还总结出可用于其他大模型交互场景的技巧。

阿里云开发者
新闻资讯8

Karpathy 最新演讲精华:软件3.0时代,每个人都是程序员

Andrej Karpathy 在 YC 旧金山创业大会演讲,介绍软件从 1.0 到 3.0 的演变,指出软件 3.0 由 LLMs 驱动,自然语言提示成编程方式。还阐述 LLMs 特性、机遇与挑战,强调为 Agent 构建软件等内容。

歸藏的AI工具箱
算法论文7

架构解耦是统一多模态模型所必须的吗?全新AIA损失:No

香港中文大学 MMLab 和美团研究者思考架构解耦是否为统一多模态模型必须,推出 AIA 损失。研究发现架构解耦未解决任务冲突,AIA 能提升模型性能,减少数据配比问题。

机器之心
新闻资讯7

OpenRouter模型7月排名:谷歌遥遥领先,DeepSeek 令牌份额占比超越Anthtropic

OpenRouter公布7月模型排名,按模型令牌份额占比,谷歌以43.2%遥遥领先,DeepSeek 19.4%超Anthropic,OpenAI仅5.9%。编程领域Claude sonnet 4占比第一,谷歌Gemini 2.5pro进步大。

AI寒武纪
算法论文8

The Batch:841 | 大语言模型正在纠正历史遗留的不公

美国北加州旧不动产契约含种族歧视条款,虽已非法但人工筛查耗时久。斯坦福和普林斯顿研究团队微调大语言模型识别圣克拉拉县契约中的歧视条款,模型可理解上下文,结果经律师确认,研究成果已开源。

DeeplearningAI
算法论文7

模型也需要睡觉!让AI打个盹,醒来更聪明

卡内基梅隆大学和马里兰大学研究发现,大模型处理长上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进长期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。

量子位
推荐文章7

大小模型协同架构在金融智能投顾中的应用与挑战

本文整理自北银金科高级算法专家尹辰轩分享,介绍大小模型协同架构下的大模型投顾方案,能解决幻觉问题、优化回答深度。还提到 12 月 19 - 20 日 AICon 北京站聚焦多热门方向。

InfoQ
推荐文章8

LLM省钱大测评!48块GH200,首个百亿级参数量实证

EfficientLLM项目聚焦LLM效率,提出三轴分类法和六大指标,实验覆盖多方面。研究表明效率优化需权衡,最优策略因任务和模型规模而异,且相关技术可迁移到跨模态模型,成果将开源。

新智元
算法论文8

一个模型千万个灵魂!Anthropic找到了防止AI陷入疯狂的防线

Anthropic和牛津大学研究发现,大模型的AI助理角色易在长对话中漂移崩塌,致其陷入幻觉。研究解析助理轴,揭示模型人格定位,还提出激活上限技术,能在保能力的同时降低有害回复率。

AIGC开放社区