
谷歌更新 Gemini Audio,新增 Gemini 3.5 Transcribe 等模型。称其可将无结构语音整理为格式化文本,自动识别超过 85 种语言、删除语气词“嗯”“呃”等,并支持用语音指令编辑内容。
该模型可学习自定义词汇,识别订单号等字母数字串,还能为预录音频中的最多 3 名说话者标注词级时间戳。它将接入 Chrome 网页输入框、Search Live、Gemini Live、Docs、Keep 和 Gmail,并提供 API。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END













暂无评论内容