「文心大模型4.5 Turbo」共找到 2992 篇相关文章
以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能
dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。
Qwen全面升级非思考模型,3B激活、256K长文、性能直逼GPT-4o
Qwen全新非思考模型Qwen3-30B-A3B-Instruct-2507上线,仅激活3B参数,性能媲美顶尖闭源模型。相比前代,推理、对齐和长文本处理能力大幅提升,在通用能力上也全面进步,适合复杂人机交互应用。
5.8k Star 基于LangGraph的Multi-Agents炒股框架,7种Agent形成金融交易闭环
TradingAgents是模拟真实交易公司运作的多智能体交易框架,用LangGraph构建,有灵活性与模块化特点。由7种LLM驱动的专业智能体协同评估市场、制定决策,还介绍了架构和实战操作。
英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了
英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。
微软再放LLM量化大招!原生4bit量化,成本暴减,性能几乎0损失
微软公布BitNet v2,性能几乎0损失,占用内存和计算成本显著降低。它首次实现对1比特LLMs的原生4比特激活值量化,通过H - BitLinear模块处理异常通道,实验显示其在多方面表现优异。
直播预约 | 推理模型的“过思考”现象与高效推理,2.5h的深度分享
本期GenTalk学术分享邀请刘梓辰、齐朋辉等4位博士生,在2025年6月6日15:00 - 17:30带来“推理模型的‘过思考’现象与高效推理”报告,由夏鹤明主持,NICE学术等支持。将分析‘过思考’因素,总结高效推理思路。
近5w颗星!一个能同时指挥多个AI写代码的开源工具来了
现在写代码,很多人想开多个AI助手。Orca是支持多AI Agent的编程开发环境,各Agent在独立git worktree里运行,互不干扰。它功能丰富,还支持多系统安装。
我的网站被攻击了48个小时,Claude Fable 5替我防下了这一切。
作者分享网站AIHOT被‘反AI小队’攻击48小时的经历。Claude Fable 5分析出攻击源于服务器共享项目无防护,还发现安全漏洞。在后续攻击中,它多举措防御,展现强大性能。
7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”
上海创智学院LeapQuest团队联合多校,在ICML 2026接收两篇论文,提出“Think with Images/Think with Videos”范式,让视觉证据参与模型推理,Ophiuchus和MedScope分别用于图像和视频诊断,表现出色。
重磅!华为何庭波正式提出τ缩放定律,晶体管密度直指1.4纳米,麒麟2026首发验证
2026年,华为何庭波提出τ缩放定律,主张将时间常数τ作为半导体演进首要优化目标。该定律在手机端和AI数据中心验证有效,还涉及产业结构变化,但仍有工具链、工艺变异等问题待解。