AI HOT 小时报|2026-06-28 19:05
龙虾日报2026年6月28日
自动从 AI HOT 精选接口收集过去约 1 小时的新动态,本次收录 2 条,供 UseClaw 测试小时级 AI 新闻流。
AI HOT 小时报|2026-06-28 19:05
数据源:AI HOT
/api/public/items?mode=selected;时间窗 since=2026-06-28T09:55:09Z。摘要由 AI HOT 提供,引用前请点原文核对。
本小时值得看
1. Grok 4.5 私测于 SpaceX 和 Tesla,性能接近 Opus
- 分类:模型
- 来源:X:Elon Musk (@elonmusk, xAI)
- 发布时间:2026-06-28T10:50:05.000Z
- 原文:https://x.com/elonmusk/status/2071184354756477041
Grok 4.5,基于我们的1.5T V9基础模型,并在补充训练中加入Cursor数据,现已在SpaceX和Tesla进入私测。初步评估显示其性能接近,或许超越Opus。
强化学习仍在持续显著改进模型,Grok Build工具链也在日益完善。
所有参与者的出色工作!
今年,@SpaceX 将每月发布完全从头训练的新模型。
2. 仅有三个AI模型在500天创业测试中盈利超过起始资本
- 分类:论文
- 来源:The Decoder:AI News(RSS)
- 发布时间:2026-06-28T10:16:13.000Z
- 原文:https://the-decoder.com/only-three-ai-models-finished-above-starting-capital-in-a-500-day-startup-survival-test
普林斯顿大学推出CEO-Bench基准测试,让AI智能体在模拟环境中运营订阅软件公司NovaMind 500天,起始资金100万美元。14个测试模型中,仅Claude Fable 5(最佳轮次盈利4715万美元)、Claude Opus 4.8(2780万美元)和GPT-5.5(2130万美元)在最佳运行中超过起始资本。一个不调用语言模型的简单规则启发式方法通过固定定价、配额和针对性开发达到1576万美元,超越除上述三款外的所有模型。多数模型无法保持连贯策略,在模拟结束前破产。该测试旨在衡量AI的长期战略决策能力。
UseClaw 观察
- 优先关注能进入真实工作流的产品更新,而不只看模型跑分。
- 优先关注 Agent、编程工具、企业集成、自动化、合规安全这些会影响数字员工落地的信号。
- 如果某条新闻能说明“谁痛、为什么信、下一步去哪”,后续可扩写成 UseClaw 深度内容。
UseClaw 持续记录 Claude、Codex、OpenClaw、AI Agent 与数字员工的真实案例、方法和产品化实践。
了解更多:https://useclaw.net/
#AI新闻#AI Agent#UseClaw#AI HOT#小时报