「大基金」共找到 5130 篇相关文章
Agent搜索哪家强?人大高瓴&快手联合发布全新评测基准GISA
人大高瓴与快手联合发布全新评测基准GISA,用于评估智能体搜索能力。它解决了现有基准反向构造、评估维度单一、答案易被记忆等问题,含373个高质量查询,实验显示当前搜索智能体距人类水平差距大。
45亿红包打响AI入口大战,百度给出另一种回应
春节期间,国内外AI圈有两件大事,国外OpenClaw在GitHub爆火,国内大厂掀起AI春节营销大战。百度率先接入OpenClaw,并推出5亿红包活动。其采用搜索+AI策略,有全栈布局优势,想走长远发展之路。
8B 端侧写作智能体 AgentCPM-Report 开源,DeepResearch 终于本地化
1月20日,8B端侧写作智能体AgentCPM - Report开源。它以端侧模型为核心,实现本地化部署与SOTA性能双重突破,亮点在于极致效能、本地安全保障,在多评测基准表现出色,部署便捷,两大创新支撑其优秀性能。
“AI火了,我们却快完了!”顶级开源框架Tailwind之父含泪裁掉75%兄弟:半年后,这个项目可能就没了
前端开源项目 Tailwind CSS 面临生存危机,创始人 Adam Wathan 称因 AI 对业务模式冲击大,一天内裁掉工程团队约 75% 员工。如趋势不变,约 6 个月后无法发工资,这与它在 AI 领域受欢迎形成反差。
这种眼镜我建议外卖快递小哥人手一个
亚马逊为快递小哥配备智能眼镜“Amelia”,早期版本正实测。它基于先进技术,能扫描包裹、导航等,明年中期量产。亚马逊还或推消费级眼镜“Jayhawk”,与Meta竞争。今年AI眼镜赛道热闹,国内外大厂纷纷入局。
AI们数不清六根手指,这事没那么简单。
作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。
亲手造出砸自己饭碗的怪兽!Anthropic联创:我们手下的顶级研究员正陷入失业恐慌
Anthropic联合创始人Jack Clark称,公司顶级研究员虽年薪百万,却因加速制造砸自己饭碗的“怪兽”而焦虑。大模型或使社会财富飙升但大量人失业,预计2028年底人类将从AI迭代链条“下岗”。
经纬领投2000万美元,Aether AI让机器人学会举一反三|甲子光年
6月18日,Aether AI获约2000万美元首轮融资。创始人黄碧薇认为主流大模型学的是相关性而非因果性,她将LLM和因果算法结合,打造因果世界模型,搭建“因果大脑”,并选择具身智能作为落地场景。
3B激活参数,干翻GPT-5.4和Opus4.6,商汤绝影把龙虾塞进了车里
商汤绝影发布端侧多模态大模型Sage,32B总参数、3B激活参数,在PinchBench评测超Claude Opus4.6等。自研SCOUT和ERL技术助力,从多维度领先同量级端侧模型,为座舱智能体提供支撑。
如何定义“人味儿”?——HeartBench评测体系建设实践
在大模型竞争格局生变,情感智能评测缺失的背景下,作者团队发布聚焦AI拟人化的中文评测体系HeartBench,介绍其设计、评估方式、迭代过程等,还沉淀了评测体系构建方法论及专家标注管理思考。