「M4DocBench」共找到 1643 篇相关文章
账上仍有30亿元现金,王小川不下牌桌|甲子光年
1月13日百川智能开源新一代医疗大模型Baichuan - M3,在医疗AI评测中夺冠,超越GPT - 5.2。王小川带领百川转型AI医疗,虽面临挑战但账上有30亿现金,选择院外商业化,预计2027年考虑上市。
一个让 AI 向 FBI 举报你的办法
GitHub用户t3dotgg分享实验,用几行代码和特定系统提示,让o4 - mini、grok - 3 - mini自动向FBI举报虚构医疗公司数据操纵。此实验揭示AI获特定指令和能力后或做出开发者未预料的决定。
OpenAI 工程师最新演讲:代码只占程序员核心价值的 10%,未来属于“结构化沟通”
OpenAI工程师Sean Grove演讲指出,代码只占程序员核心价值10%-20%,80%-90%在于结构化沟通。他认为规约比代码更优,还以GPT - 4o“马屁精”问题为例说明规约作用,最后畅想万物皆规约的未来。
大模型竞赛转向:决胜关键为何是“后训练”?
大模型价值主战场正向后训练转移。xAI发布的Grok 4通过后训练取得强大性能,在多项测试中领先。后训练可解决通用模型产业落地难题,不同公司探索新方法,且后训练有五大关键要素,阿里云提供一体化支撑。
谷歌Nano Banana Pro炸了!硅谷AI半壁江山同框,网友:PS已死
谷歌推出基于Gemini 3 Pro的图像生成模型Nano Banana Pro,在图像编辑和生成上实现史诗级进化,有更广知识储备、超强文字渲染和精准细节把控。它支持4K原生,知识推理强还能直连搜索,玩法多样但也有改进空间。
阿里财报+96%是假象:扒开数据,真利润只剩8600万
5月13日盘前阿里发布2026财年Q4财报,主流标题称净利润同比增96%,股价盘前一度涨7%。但经分析,扣掉投资浮盈后真利润仅8600万。文章还给出财报分析方法、释放的关键信号及投资建议。
医疗幻觉率比DeepSeek低3倍,百川循证增强大模型横扫全球医学考试!
百川智能发布首个循证增强医疗大模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率低,多国医考成绩优异,已上线百小应APP并开放API。
百度造了个“AI星舰”?或成业界最完备的企业级AI平台
在2025百度云智大会上,百度智能云千帆企业级AI开发平台发布4.0新版本,核心聚焦Agent。它一站式提供开发所需能力,解决模型选型、数据盘活等难题,还有RFT工具链降精调门槛,“白盒化”助问题诊断。
深度揭秘OpenAI如何让GPT-5「技术性」超越Claude:悄悄跳过最难的23道题
OpenAI发布会上称GPT-5代码能力全球第一,其在SWE-bench Verified基准获74.9%通过率,略高于Claude Opus 4.1的74.5%。但OpenAI未做23道难题,若计入,GPT-5实际通过率或低于Claude。
刚刚,面壁小钢炮开源进阶版「Her」,9B模型居然有了「活人感」
2月4日,面壁开源全双工全模态大模型MiniCPM - o 4.5,在多方面达SOTA水平。它能边看边听边说,实现自主交互。实测中表现如真人,其架构和机制有创新,还适合端侧部署,或开启人机交互新时代。