开源小模型」共找到 9273 篇相关文章

算法论文8

微调已死?Agentic上下文工程登场,无需微调实现模型进化

斯坦福大学等团队提出 Agentic Context Engineering 技术,让语言模型无需微调自我提升。它将上下文视为作战手册,引入三种协作角色与三项创新,实验显示其在两类任务上表现优异,成本和延迟显著下降。

机器之心
新闻资讯8

智谱创始人唐杰透露:原生多模态模型将在数月内上线

智谱创始人唐杰透露原生多模态模型数月内上线。智谱上市后股价涨幅大,但多模态是短板。唐杰还判断今年AI最可能在长时程任务突破,阐述技术支柱、自我进化等观点,称将重塑各行业。

AI前线
新闻资讯7

当AI开始过度思考「hey」这个字…

两张对话截图展现语言模型缺陷,用户发简单问候,模型过度分析,从问候语正式程度到表情符号语义权重,这种过度分析让对话不自然,错过人类交流重点。

AI工程化
开源动态8

BigBang-Proton: 自回归基座模型统一语言、科学和物质世界

超对称公司发布新版基座模型 BigBang - Proton,实现多学科问题与 LLM 统一预训练和推理,挑战主流 AGI 技术路线。它有三项创新,在多专业学科任务表现出色,还提出宇宙尺度压缩构想。

InfoQ
算法论文8

推理路径的动态调控:让大模型学会“恰到好处”的思考

当前大模型推理路径存在冗余问题,本文提出测试时提示干预框架PI(π),通过《When/How/Which》三模块协同,将人类专家经验融入推理过程,在多个STEM基准测试中缩减推理步骤、提升准确率。

深度学习自然语言处理
算法论文8

ICML 2025 | CoTo:让LoRA训练「渐入佳境」,模型融合、剪枝样样精通

来自多机构研究者提出CoTo渐进式训练策略,解决LoRA训练难题。该策略在训练早期随机失活部分适配器,后期提高激活概率,提升模型融合、剪枝能力,还能增强单任务性能与训练效率,已被ICML 2025接收。

机器之心
新闻资讯7

Karpathy:大模型交互的第三种范式来了?这是不是夸大其词

Anthropic 上线 Claude Tag,可让团队在 Slack 与 Claude 协作,能完成写 PR、数据分析等任务,有多人协作、积累上下文等特点。Karpathy 认为这是大模型 UI 第三次大改,但评论区有质疑,不过有大咖背书或成‘数字员工’。

AI工程化
产品应用7

GPT-5.4发布,最适合OpenClaw的天选模型登场了。

GPT-5.4发布,作者认为它是OpenClaw天选模型。此前Claude贵且受限,GPT-5.3-Codex世界知识差。GPT-5.4代码能力强、世界知识优,还具多特性,如大上下文窗口,目前ChatGPT已上线。

数字生命卡兹克
算法论文8

【医学影像分割】UN-SAM:一种高效且通用的细胞核分割模型

文章提出UN - SAM框架解决现有SAM在医学影像分割依赖人工标注、跨域泛化不足问题。它含三大模块,能自动生成提示、增强特征判别力和跨域分割精度,实验显示其在多数据集表现优,代码已开源

机器学习AI算法工程
产品应用8

没想到 50 岁了我开始手搓游戏:灵光闪现

作者池建强分享AI领域“生成涌现”现象,以Gemini 3.0演示为例,又介绍蚂蚁集团的灵光App,其闪游戏功能让普通用户用一句话生成游戏,能修改迭代,体现AI构建系统能力,创作平权或到来。

MacTalk