FastMetal 把视频生成塞进 Mac 笔记本:30 秒出一段 480P,本地 3.9GB 显存就够
Sky Computing Lab 开源 FastMetal,把 FastWan-QAD 视频模型完整搬到 Apple Silicon 上。480P 5 秒视频在 Mac 本地 30 秒即可生成,无需 CUDA 和云端,默认 INT8 量化,最低 3.9 GiB 内存就能跑。对本地创作和苹果生态用户来说,这是一份真正可用的方案。
覆盖视频生成、音频处理、语音、音乐和多媒体创作工具与行业变化。
Sky Computing Lab 开源 FastMetal,把 FastWan-QAD 视频模型完整搬到 Apple Silicon 上。480P 5 秒视频在 Mac 本地 30 秒即可生成,无需 CUDA 和云端,默认 INT8 量化,最低 3.9 GiB 内存就能跑。对本地创作和苹果生态用户来说,这是一份真正可用的方案。
LTX-2.5 原生接入 ComfyUI,报道显示其在两张英伟达 GB200 上生成 10 秒 720P 视频用时 6.8 秒;LTX-2.5 Fast 还提供音频生成与按秒计费方案。本文分析其对创作者、开发者和中文用户的工作流影响。
MiniMax 推出 Music 3.0,开放模型权重,支持最长五分钟的全流程音乐生成。这意味着从作曲到编曲再到混音,AI 可以一次性完成。开源策略让中小开发者和内容创作者首次拿到接近商用水平的音乐模型。
据海外安全研究者披露,AI会议记录平台tl;dv因数据库缺少租户隔离,18.1万段会议录音对所有登录用户开放读取,涉及23国政府与多所高校。漏洞报告6个月仍未修复,实时通话也可闯入。
阿里千问 Wan3.0 视频生成模型全网公测,主打 30 秒一镜到底、导演级镜头叙事与超高性价比。30 秒时长背后是长时序一致性技术硬仗,创作者和企业用户都能找到切入点,但 API 与商用授权仍是悬念。
MiniMax 发布的全模态生成模型 MiniMax-H3 已经有人把它移植到 MLX,M5 Max MacBook Pro 下载约 115GB 模型后,本地生成一段 15 秒带音频视频不到 45 分钟。本地视频生成对创作者和开发者的实际意义值得拆解。
OpenAI 联合创始人 Greg Brockman 公开 GPT-Live 实时音频架构,主打边说边听的全双工能力,意图让推理与工具调用不再打断对话。这一改动是 ChatGPT 语音体验的一次底层换血。
MiniMax 发布全能多模态模型 H3,支持文本、图像、视频、音频联合理解与生成,可输出 2K 分辨率、原生立体声 15 秒视频,2K 定价不到主流三分之一,并即将开源模型权重。
Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,视频预测消耗九成以上算力。与机器人公司 mimic 合作的 FLUX-mimic 已在奥迪产线试跑,揭示了视频生成模型走向物理世界的路径。
Black Forest Labs 在 Early Access 阶段推出 FLUX 3 多模态模型,单次可生成最长 20 秒视频并自带原生音轨。本文拆解它的技术逻辑、与 Sora/Veo/Runway 的差异,以及创作者和国内用户该看什么。
昆仑万维董事长方汉在WAIC上宣布2026年为"世界模型元年",发布Matrix-Game 3.5世界模型与Mureka v9.5、O3音乐模型。5B模型720p分辨率下单卡可达20FPS实时生成,实现Patch级记忆注入,核心架构已开源。
阿里通义实验室推出实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中拿下综合第一,超过 GPT-Realtime-2。国产语音模型正在把差距拉开。
新加坡视频生成公司 PixVerse 完成 4.39 亿美元 C 轮扩展融资,估值突破 20 亿美元。它有 V、C、R 三条产品线,注册用户超 1.5 亿、月活超 1500 万,阿里参与投资,今年还有新模型和企业拓展计划。