Legato 推出 AI 助听眼镜 Legato Frames,起售价 999 美元
听力科技初创公司 Legato 周四宣布其 AI 助听眼镜 Legato Frames 正式开售,起售价 999 美元,面向轻至中度听力损失的成年人。该眼镜将专利助听技术集成于镜腿,AI 系统可区分人声与背景噪音,双扬声器系统在耳旁数英寸处降低 99% 的漏音,所有处理均在眼镜端完成,不含摄像头也不录音。
听力科技初创公司 Legato 周四宣布其 AI 助听眼镜 Legato Frames 正式开售,起售价 999 美元,面向轻至中度听力损失的成年人。该眼镜将专利助听技术集成于镜腿,AI 系统可区分人声与背景噪音,双扬声器系统在耳旁数英寸处降低 99% 的漏音,所有处理均在眼镜端完成,不含摄像头也不录音。
GPT-6 Astra 构建了实验性工具 Photo Scrubber,用于自动识别并模糊照片中的陌生人面部。该工具基于 Google MediaPipe C++ 库编译为 WebAssembly,并集成 BlazeFace 人脸检测模型实现本地处理。
Liquid AI 发布 LFM2.5-VL-DSpark 实验性草稿模型,为 LFM2.5-VL-3B 视觉语言模型引入推测解码路径。该模型增加 280M 参数,在 H100 上实现最高 2.66x 解码加速,并支持 llama.cpp、MLX-VLM 和 SGLang。
Hugging Face 宣布 transformers 库新增对 GGUF 格式模型的支持,允许用户通过 from_pretrained 接口在本地加载并运行量化模型。该功能目前主要面向 Apple Silicon 设备,通过复用 ggml 内核实现接近 llama.cpp 的推理性能,并支持通过 transformers serve 暴露 OpenAI 兼容 API。
推荐理由:原文展示了在 transformers 中直接加载 GGUF 量化模型的方法,并给出了 Apple Silicon 上的性能对比数据。
oMLX 创建者 Jun Kim 加入 Hugging Face,继续领导该项目并保持 Apache 2.0 开源协议。Hugging Face 将利用 oMLX 作为新想法的测试平台,重点优化从 transformers 模型定义到 MLX 参考实现的转换流程,以加速本地 AI 生态发展。
Google Research 提出 PhotoScan,一个从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架。
Google DeepMind 发布多语种手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:SL2T 把多语种手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与隐私设计。
K-Search 框架扩展了 MLX 后端,通过结构化翻译层将 CUDA 内核知识自动适配为 Apple Silicon 的高性能内核。该方法在 Apple Silicon 上达到接近专家水平的性能,相比原生 MLX Attention 内核实现 0.97x 加速,并在 Mamba SSM 内核上较社区 mlx-lm 实现获得最高 20x 的 prefill 加速。
Google Research 发布一种新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,给出端侧推理在内存与能耗约束下的具体优化路径。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 去掉多模态编码器并把视觉音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后采集 8 秒面部视频,通过端侧深度学习估算心率,与心电图对比的平均绝对百分比误差低于 10%,覆盖所有肤色人群。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
Google 发布一套零信任隐私分析方案,将新型单次消息密码学聚合协议与 TEE 结合,使设备无需多轮在线即可提交数据。该方案保证 Google 只能获得匿名化的群体聚合洞察,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 认证则向参与者证明协议按公开代码正确执行。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 全系以 Apache 2.0 开源并给出从 3B 到 675B 的规格与部署路径,读者可据此判断开源前沿模型的可用边界。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/s,以 Apache 2.0 许可开源。
推荐理由:官方给出 128k 上下文、150 tokens/s 与 Apache 2.0 开源等参数,可据此判断小模型在端侧与多模态场景的可用性。