「LLaVA - OneVision - 1.5」共找到 3226 篇相关文章
142 TFLOPS 的差距:为什么在 Blackwell 上 FP4 MoE 算子工程至关重要
文章对三种主流MoE后端在Blackwell B200 GPU上做基准测试,发现SGLang与vLLM有142 TFLOPS差距,小batch时SGLang快1.84×。差异源于kernel融合、面向Blackwell的CUTLASS schedule及自适应grid sizing等优化。
DeepSeek V3到V3.2的进化之路,一文看全
知名AI研究者Sebastian Raschka发布深度博客,详细梳理DeepSeek V3到V3.2进化历程。DeepSeek V3.2性能对标GPT - 5和Gemini 3.0 Pro,且为开放权重模型,报告涵盖众多有趣领域和知识。
宇树科技官宣:年内提交IPO,或将冲刺科创板
9月2日晚,宇树科技声明预计四季度提交上市申请。公司产品含四足、人形机器人等,商业化进展快,财务盈利。此前已开启上市辅导,C轮融资后估值超百亿。同时对Go1安全漏洞作声明。
无需外部数据!AI自问自答实现推理能力进化
卡内基梅隆大学团队提出SQLM框架,这是无需外部数据的自我提问模型,含提问者和解答者角色。通过强化学习最大化期望奖励,设计自监督奖励函数。实验显示其能提升Qwen2.5 - 3B - Instruct多任务准确率。
看遍奥斯卡后,VLM达到电影摄影理解新SOTA|上海AI Lab开源
上海人工智能实验室等推出ShotBench、ShotVL及ShotQA,ShotBench含超3.5k问答对,ShotQA约7万个问答对。ShotVL在ShotBench评测中表现出色,3B参数的ShotVL-3B增益达19.0%,超越GPT - 4o等。
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。
OpenAI财报泄露!3个月能烧37亿美元,年亏损涨8倍
OpenAI最新泄露财报显示,2025年经营数据糟糕,收入130.7亿美元,支出340亿,亏损385亿,是24年近8倍。2026年Q1烧钱37亿美元。不过账上现金充裕,IPO虽受影响但不绝对。
一文彻底看懂6G!
文章深度解读6G,介绍其定义、与5G差异、网络指标、发展进展等。指出6G是新一代移动通信标准,速率更快,有革命性跃迁,预计2029年发布首个商用标准版本,2030年左右商用。
代码里插广告,腾讯 Codebuddy 们 “背锅”?DeepSeek “极你太美”事件,其他模型也逃不掉?
网友发现腾讯 Codebuddy 改写代码时插入广告,字节 Trae 国内版生成结果有‘极’字 bug,根源指向 DeepSeek V3.1。除 DeepSeek 外,Gemini、Grok、Qwen3 等模型也有类似问题。大家对原因有多种猜测。
前两天刚被群嘲,ChatGPT转头就解决了一个数学难题
前些天,OpenAI研究员宣称GPT - 5‘发现’数学难题解法被指只是检索文献引群嘲。但加州大学洛杉矶分校教授用ChatGPT解决凸优化未决问题,还有教授用其发现命题反例,甚至要将其列为论文一作,AI正成研究伙伴。