📌 阅读指引:每个主题下的资讯按推荐阅读顺序排列,越全面/重磅的条目越优先。
本日报覆盖 2026-07-24 前后发布的 AI 领域最新动态,涵盖六大主题。
来源于:Lele's dodo
🎬 视频生成 (Video Generation)
1. Black Forest Labs 发布 FLUX 3 — 多模态基座模型
摘要 Black Forest Labs 于 7 月 23 日发布 FLUX 3,基于 Self-Flow 架构,能同时生成图像、视频(最长 20 秒)+ 原生音频,并支持动作预测,向世界模型迈出关键一步。
关键点
- 统一架构同时学习图像、视频和音频
- 在 69% 对比中优于 Grok Imagine Video,60% 优于 Kling v3 Pro
2. Kuaishou Kling 持续迭代
摘要 Kling AI 在原生音频场景和多镜头故事讲述方面表现突出。
关键点
- 2026 年格局:PhotoGrid(多模型切换)、Kling(音频/故事性)、Runway(专业创作)、Veo 3.1(谷歌生态)
PhotoGrid Best AI Video Generators
3. LTX-2.3 标杆开源视频生成模型
摘要 22B 参数非对称双流通用 Transformer,支持原生音画联合生成。
关键点
- 采用非对称双流 Diffusion Transformer,视频流与音频流双向跨模态注意力
- 蒸馏版可在 RTX 5090(32GB FP8)运行
🖼️ 图像生成 (Image Generation)
1. FLUX 3 登场:图像质量显著跃升
摘要 同一架构训练图像和视频,质量相比 FLUX 2 大幅提升。
2. Adobe Firefly Custom Models 公开 Beta
摘要 Adobe 推出 Firefly 自训练模型公测,团队可用自有素材定制。
3. GPT Image 2.0 引领 2026 图像生成格局
摘要 OpenAI GPT-image-2 在文本渲染与指令遵循方面表现突出。
🤖 Agent
1. Meta AI 从聊天机器人变身多步骤任务运行助手
摘要 Meta 于 7 月 24 日宣布更新 AI 助手,支持访问日历、生成简报、多步骤自主执行。
关键点
- 可连接日历自动识别行程冲突并生成每日简报
- 自动执行周期性任务:餐饮计划、产品补货、动态汇总
- 可搜索网络及 Meta 生态内容并自动生成报告和 PPT
2. AMD 发布 Helios 机架级 AI 计算平台
摘要 AMD 在 Advancing AI 2026 正式发布 Helios,专注 Agentic 时代全栈算力。
关键点
- 单机架最高 2.9 EFLOPS FP4、31TB HBM4、1.7 PB/s 内存带宽
- OpenAI、Meta、Anthropic 已确认大规模部署
- AMD 承诺向 Anthropic 投资高达 50 亿美元
3. 华为云发布 Agentic Infra
摘要 华为云在泰国公布 Agentic Infra,专为 AI Agent 开发与部署设计。
4. GOAI 全球开源 AI 挑战赛启动
摘要 7 月 21 日发布 Agent Infra、Boundless Agents、AI for Research、Embodied Future 四大赛道。
5. NVIDIA KAIST 联合 AI 研究实验室
摘要 NVIDIA 与 KAIST 联合成立 AI 研究实验室,专注 Agentic AI 模型。
💬 LLM(大语言模型)
1. 前沿模型 2026 年 7 月格局更新
摘要 多个前沿模型全面测试:GPT-5.5(1.05M context)、Claude Opus 4.7(SWE-bench 82.1%)、Gemini 3.1 Pro($2/$12 per M tokens)。
关键点 Summary
- GPT-5.5: $5/$30 per M tokens
- Claude Opus 4.7: SWE-bench 82.1%, $5/$25 per M tokens
- Gemini 3.1 Pro: $2/$12 per M tokens
- 前沿推理成本相比 6 个月前降低约 3 倍
2. Alphabet 8110 亿美元 Commitments + 1240 亿美元 Anthropic 持股
摘要 Google 母公司 Alphabet 公布未来购买承诺,Anthropic 单笔持股估值约 1240 亿美元。
关键点
- Alphabet 2026 年资本支出高达 2050 亿美元
- 大部分投入芯片、数据中心、电力、基础设施
3. 本地 LLM 2026 夏季指南
摘要 MoE + 4-bit 量化成主流,Qwen 3.6-35B-A3B 为综合首选。
4. DeepSeek V4 Preview API 退役
摘要 V4-Pro 达 80.6% SWE-bench,旧 API 命名于 7 月 24 日后退役。
关键点
- V4-Pro 1.6T 总参数(~49B 激活),Flash 版 284B 总参数(~13B 激活)
- 纯文本模型,不支持多模态输入
5. Nvidia 与 Palantir 呼吁勿封禁开放 AI 模型
摘要 7 月 24 日 FT 报道,Nvidia 和 Palantir 联合呼吁美国政府不要禁止开放 AI 模型。
🔗 MLLM / 多模态大模型
1. FLUX 3 — 原生多模态统一模型
摘要 单一模型统一图像、视频、音频处理,基于 Self-Flow 架构。
关键点
- 支持文本到视频/图像、图像到视频、视频到视频等多种组合
- 可衔接多场景,达到数分钟连贯视频
2. TopoAgent — 基于 DAG 的科学推理
摘要 以 DAG 替代线性推理路径,在物理/化学/数学等科研推理上全面超越。
3. SmartVL — 联合 Token-计算自适应推理
摘要 统一自适应推理框架,联合控制视觉 Token 与计算量。
4. Vision-DeepResearch (ICML 2026)
摘要 针对多模态深度研究能力的 MLLM 与评估基准。
5. MLLM for 遥感图像理解:领域专用 vs 通用模型
摘要 最新调查研究发现,在多个遥感理解任务上通用视觉 MLLM 甚至能胜出领域专用模型,但在空间关系推理、细粒度视觉理解等方面仍有局限。
🌍 世界模型及多模态前沿
1. FLUX 3 直指世界模型
摘要 多模态 Flow Model 被公认通往世界模型的实质性步骤,FLUX 3 明确以世界学习为目标。
2. 2026 年为世界模型突破年
摘要 Stanford AI Index、MIT Tech Review 等多家权威将 2026 年定义为世界模型突破年。
3. ACE Robotics Kairos 世界模型四大基准登顶
摘要 Kairos 世界模型在 RoboTwin 2.0、LIBERO-Plus 等四项国际基准上均排名第一。
4. WAIC 2026 展示中国首个 AI 音乐生成硬件
摘要 2026 年世界人工智能大会(WAIC)上,天普类 V4.7 模型让 AI 可以即兴与人类合奏,垂直方向的 AI + 世界模拟朝着音频/音乐领域推进。
来源于:Lele's dodo