「泛化推理能力」共找到 4758 篇相关文章
真正能离线跑的完全开源翻译工具
Argos Translate是用Python写的开源离线翻译引擎,底层靠OpenNMT,推理用CTranslate2。可当库、命令行、桌面软件用,模型是本地zip包,不联网也能用。支持主流及小众语言,有多种使用方式。
超实用提示词模板!AI科学家教你用协作提示词激发大模型潜力
文章由知名AI科学家Lance Eliot所写,指出主流大语言模型因训练机制变得‘短视’,缺乏深度协作能力。介绍协作提示词技术,能让AI成为主动引导者,并以测试展示效果,还说明了适用场景。
模型汤新做法!Meta|提出“类别专家汤”:SoCE,大幅提升模型性能,刷新SoTA!
大语言模型领域,提升性能常需高算力、大量数据和长时间训练。Meta提出新型模型汤技术SoCE,通过分析类别相关性操纵模型权重,在BFCL上刷新SOTA记录,为开源社区指明低成本进化之路。
被轻视的巨大市场,大厂做不好的Local Agent为何难?| 甲子光年
文章指出大模型边际收益递减,AI竞赛规则生变,产业从‘参数竞赛’转向‘效率革命’。本地Agent有潜力,但主流产品体验差。GreenBitAI深耕低比特模型,推出Libra,有望撬开万亿美元增量市场。
卧底硅谷AI独角兽60天:没有KPI,自觉996,不接受远程办公
本文揭秘了AI编程独角兽Cursor早期工作氛围。它招人不走寻常路,无KPI但员工自发996。产品聚焦提升专业开发者能力,奉行Dogfooding文化。靠使命驱动,两年成业界黑马,重产品轻利益。
3A大作!阿里ROLL团队从基建->算法->机理,推动RL4LLM全栈协同优化
阿里巴巴ROLL团队联合高校推出「3A」协同优化框架,推动「强化学习用于大语言模型(RL4LLM)」迈向新范式。Async架构提升GPU利用率,AsyPPO降低计算资源消耗,Attention机制提升训练效率与可解释性。
BigBang-Proton: 自回归基座模型统一语言、科学和物质世界
超对称公司发布新版基座模型 BigBang - Proton,实现多学科问题与 LLM 统一预训练和推理,挑战主流 AGI 技术路线。它有三项创新,在多专业学科任务表现出色,还提出宇宙尺度压缩构想。
震荡股市中的AI交易员:DeepSeek从从容容游刃有余? 港大开源一周8k星标走红
2025年10月美股震荡,港大黄超教授团队开源AI-Trader项目启动实盘测试,上线一周在GitHub获近8K星标。6位AI交易员投入纳斯达克100交易,实验测试其交易纪律、市场耐心和信息过滤能力。
兄弟们,起飞啦,揭秘Claudable给你写代码的魔力 Github 3k star !!!
Claudable是Opactor AI组织开放的开源项目,它结合Claude Code强大的AI代理能力,能把自然语言描述的产品概念自动翻译成可部署的Web应用,解决传统Web开发痛点,功能强大且应用场景广泛。
别再只关注KV Cache了! LLM稀疏性新洞察:为何模型越深越稀疏?UNCOMP从矩阵熵给出答案
团队论文UNCOMP获EMNLP 2025主会接收,它提出高效推理框架,从截断矩阵熵视角解释LLM深层稀疏现象。还能识别关键结构、找到最优压缩策略,设计的UNCOMP框架优化KV Cache,实验效果佳。