Hello World


📌 阅读指引:每个主题下的资讯按推荐阅读顺序排列,越全面/重磅的条目越优先。

本日报覆盖 2026-07-24 前后发布的 AI 领域最新动态,涵盖六大主题。
来源于:Lele's dodo



🎬 视频生成 (Video Generation)


1. Black Forest Labs 发布 FLUX 3 — 多模态基座模型

摘要 Black Forest Labs 于 7 月 23 日发布 FLUX 3,基于 Self-Flow 架构,能同时生成图像、视频(最长 20 秒)+ 原生音频,并支持动作预测,向世界模型迈出关键一步。

关键点

- 统一架构同时学习图像、视频和音频

- 在 69% 对比中优于 Grok Imagine Video,60% 优于 Kling v3 Pro

BFL Blog - FLUX 3


2. Kuaishou Kling 持续迭代

摘要 Kling AI 在原生音频场景和多镜头故事讲述方面表现突出。

关键点

- 2026 年格局:PhotoGrid(多模型切换)、Kling(音频/故事性)、Runway(专业创作)、Veo 3.1(谷歌生态)

PhotoGrid Best AI Video Generators


3. LTX-2.3 标杆开源视频生成模型

摘要 22B 参数非对称双流通用 Transformer,支持原生音画联合生成。

关键点

- 采用非对称双流 Diffusion Transformer,视频流与音频流双向跨模态注意力

- 蒸馏版可在 RTX 5090(32GB FP8)运行

LTX Blog




🖼️ 图像生成 (Image Generation)


1. FLUX 3 登场:图像质量显著跃升

摘要 同一架构训练图像和视频,质量相比 FLUX 2 大幅提升。


2. Adobe Firefly Custom Models 公开 Beta

摘要 Adobe 推出 Firefly 自训练模型公测,团队可用自有素材定制。

NewsData


3. GPT Image 2.0 引领 2026 图像生成格局

摘要 OpenAI GPT-image-2 在文本渲染与指令遵循方面表现突出。

Cliprise




🤖 Agent


1. Meta AI 从聊天机器人变身多步骤任务运行助手

摘要 Meta 于 7 月 24 日宣布更新 AI 助手,支持访问日历、生成简报、多步骤自主执行。

关键点

- 可连接日历自动识别行程冲突并生成每日简报

- 自动执行周期性任务:餐饮计划、产品补货、动态汇总

- 可搜索网络及 Meta 生态内容并自动生成报告和 PPT

Unite.AI


2. AMD 发布 Helios 机架级 AI 计算平台

摘要 AMD 在 Advancing AI 2026 正式发布 Helios,专注 Agentic 时代全栈算力。

关键点

- 单机架最高 2.9 EFLOPS FP4、31TB HBM4、1.7 PB/s 内存带宽

- OpenAI、Meta、Anthropic 已确认大规模部署

- AMD 承诺向 Anthropic 投资高达 50 亿美元

TechWire Asia


3. 华为云发布 Agentic Infra

摘要 华为云在泰国公布 Agentic Infra,专为 AI Agent 开发与部署设计。

AI-Watch


4. GOAI 全球开源 AI 挑战赛启动

摘要 7 月 21 日发布 Agent Infra、Boundless Agents、AI for Research、Embodied Future 四大赛道。

Wallstreet Online


5. NVIDIA KAIST 联合 AI 研究实验室

摘要 NVIDIA 与 KAIST 联合成立 AI 研究实验室,专注 Agentic AI 模型。

GlobeNewswire




💬 LLM(大语言模型)


1. 前沿模型 2026 年 7 月格局更新

摘要 多个前沿模型全面测试:GPT-5.5(1.05M context)、Claude Opus 4.7(SWE-bench 82.1%)、Gemini 3.1 Pro($2/$12 per M tokens)。

关键点 Summary

- GPT-5.5: $5/$30 per M tokens

- Claude Opus 4.7: SWE-bench 82.1%, $5/$25 per M tokens

- Gemini 3.1 Pro: $2/$12 per M tokens

- 前沿推理成本相比 6 个月前降低约 3 倍

ChatGPT AI Hub


2. Alphabet 8110 亿美元 Commitments + 1240 亿美元 Anthropic 持股

摘要 Google 母公司 Alphabet 公布未来购买承诺,Anthropic 单笔持股估值约 1240 亿美元。

关键点

- Alphabet 2026 年资本支出高达 2050 亿美元

- 大部分投入芯片、数据中心、电力、基础设施

The Neuron


3. 本地 LLM 2026 夏季指南

摘要 MoE + 4-bit 量化成主流,Qwen 3.6-35B-A3B 为综合首选。

DevelopersIO


4. DeepSeek V4 Preview API 退役

摘要 V4-Pro 达 80.6% SWE-bench,旧 API 命名于 7 月 24 日后退役。

关键点

- V4-Pro 1.6T 总参数(~49B 激活),Flash 版 284B 总参数(~13B 激活)

- 纯文本模型,不支持多模态输入

HostingSeekers


5. Nvidia 与 Palantir 呼吁勿封禁开放 AI 模型

摘要 7 月 24 日 FT 报道,Nvidia 和 Palantir 联合呼吁美国政府不要禁止开放 AI 模型。

AInvest




🔗 MLLM / 多模态大模型


1. FLUX 3 — 原生多模态统一模型

摘要 单一模型统一图像、视频、音频处理,基于 Self-Flow 架构。

关键点

- 支持文本到视频/图像、图像到视频、视频到视频等多种组合

- 可衔接多场景,达到数分钟连贯视频

BFL Blog - FLUX 3


2. TopoAgent — 基于 DAG 的科学推理

摘要 以 DAG 替代线性推理路径,在物理/化学/数学等科研推理上全面超越。

ChatPaper - TopoAsset


3. SmartVL — 联合 Token-计算自适应推理

摘要 统一自适应推理框架,联合控制视觉 Token 与计算量。

ChatPaper - SmartVL


4. Vision-DeepResearch (ICML 2026)

摘要 针对多模态深度研究能力的 MLLM 与评估基准。

GitHub


5. MLLM for 遥感图像理解:领域专用 vs 通用模型

摘要 最新调查研究发现,在多个遥感理解任务上通用视觉 MLLM 甚至能胜出领域专用模型,但在空间关系推理、细粒度视觉理解等方面仍有局限。

ChatPaper




🌍 世界模型及多模态前沿


1. FLUX 3 直指世界模型

摘要 多模态 Flow Model 被公认通往世界模型的实质性步骤,FLUX 3 明确以世界学习为目标。

BFL Blog


2. 2026 年为世界模型突破年

摘要 Stanford AI Index、MIT Tech Review 等多家权威将 2026 年定义为世界模型突破年。

Stanford HAI 2026 Report


3. ACE Robotics Kairos 世界模型四大基准登顶

摘要 Kairos 世界模型在 RoboTwin 2.0、LIBERO-Plus 等四项国际基准上均排名第一。

GlobeNewsire


4. WAIC 2026 展示中国首个 AI 音乐生成硬件

摘要 2026 年世界人工智能大会(WAIC)上,天普类 V4.7 模型让 AI 可以即兴与人类合奏,垂直方向的 AI + 世界模拟朝着音频/音乐领域推进。

腾讯新闻


来源于:Lele's dodo

Author: Lele
Reprint Policy: All articles in this blog are reprinted for learning purposes only unless otherwise stated.
评论
 Previous
SpringBoot基础(一) SpringBoot基础(一)
1.SpringBoot简介Spring Boot是由Pivotal团队提供的全新框架,其设计目的是用来简化新Spring应用的初始搭建以及开发过程。该框架使用了特定的方式来进行配置,从而使开发人员不再需要定义样板化的配置。 1.1pom文
2019-12-06
Current 
Hello World Hello World
Welcome to Hexo! This is your very first post. Check documentation for more info. If you get any problems when using Hex
2026-07-25
  TOC