跳到正文

#视频

今日 1 条
今天10月2日周五
10月1日周四
  1. AWS Machine Learning Blog31

    Condé Nast 如何利用 Amazon Bedrock 构建多模态视频发现系统

    Condé Nast 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现系统,将内容检索时间从 250 分钟缩短至 2 分钟以内。该系统采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频信号进行联合编码,支持基于意图的语义搜索。此前编辑团队依赖标题和描述手动查找素材,导致运营效率低下。

9月29日周二
  1. AWS Machine Learning Blog22

    在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第 2 部分)

    在 Amazon SageMaker AI 上部署同一个 AWS vLLM-Omni DLC 镜像的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。文本提示词先生成 PNG,再连同运动提示词经 Amazon S3 传给视频端点,生成的 MP4 存回 S3,示例提供命令行与 Streamlit 界面。

9月25日周五
  1. Latent Space80

    Runway 实时世界模型 GWM Worlds 2 与 WorldPrompt 技术解析

    Runway 发布研究预览 GWM Worlds 2,引入 WorldPrompt 格式以支持实时交互式视频与音频生成。该模型通过自回归扩散和蒸馏技术实现 720p 24fps 的实时流式输出,允许用户通过提示词控制场景中的角色、相机和环境事件。

    推荐理由:通过Runway高管访谈,揭示了实时世界模型在自回归生成、蒸馏加速及因果一致性上的工程挑战与Agent应用潜力。

  2. Google DeepMind76

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟流式视频与语音结合实现近实时视觉存在。该功能支持 97 种语言的唇形同步,并能在对话进行中后台异步执行工具调用,目前已通过 Gemini Enterprise 开放。

    推荐理由:原文展示了实时视频与语音结合的多模态交互能力,以及后台异步工具调用机制,为构建企业级虚拟助手提供了具体参考。

9月23日周三
9月21日周一
9月2日周三
8月28日周五
7月1日周三
  1. Google DeepMind82

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,4 秒生成文本到图像,每张 1K 图像 0.034 美元;后者支持高质量视频生成与对话式编辑,输出视频定价为每秒 0.10 美元。

    推荐理由:两款模型同日开放开发者入口,并给出延迟、单价与能力边界,便于评估图像到视频的串联工作流。

5月18日周一
  1. Google DeepMind82

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式视频编辑

    Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮对话编辑视频。

    推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有