AiNews
⚡ 速览 🧠 模型
← 返回首页

#speech-to-text

包含标签 "speech-to-text" 的文章,共 5 篇。

🧠 模型动态 Hacker News

开源语音识别模型 CrisperWhisper:实现精准逐字转录

CrisperWhisper 是一款专注于逐字转录的开源语音识别模型,主要解决传统 ASR 系统在处理口语时常见的润色、省略和幻觉问题。它不作过度优化,完整保留语音中的停顿、重复和原始用词,忠实还原说话内容。该模型为法律庭审记录、影视字幕制作及语音数据分析提供了高确定性的原始文本方案,大幅降低了人工校对成本。

🛠️ 开发工具 Hacker News

Dictata:本地 Whisper 语音听写与大模型清洗工具

Dictata 是一个开源的语音听写工具,结合了本地运行的 Whisper 模型与大语言模型。它在本地将语音转为原始文本,再通过大模型自动修正错别字、补全标点并优化格式。这种本地优先加 AI 后处理的架构既保护了隐私,又提升了转写文本的可读性,适合开发者和日常办公使用。

🛠️ 开发工具 V2EX

OpenASR:统一本地多模型语音转文字

OpenASR项目旨在解决当前本地语音转文字(ASR)工具的痛点,为中国开发者和AI创业者提供一个统一、高效的解决方案。项目发起人观察到,尽管近年来本地ASR模型(如Whisper、Qwen3-ASR、SenseVoice、FireRed、Dolphin、X-ASR等)发展迅速,但普通用户体验这些模型的门槛极高,主要体现在需要上传云端、仅支持单一模型、或需自行配置复杂的Python环境、CUDA及模型权重。 OpenASR的核心目标是构建一个完全本地化的ASR工具,确保用户音频数据不上传服务器,模型下载后可断网运行,从而保障数据隐私和离线可用性。该工具提供多项实用功能,包括本地音视频转文字、实时字幕、全局语音输入、命令行接口(CLI)以及本地API,并支持一键切换多种ASR模型。 项目强调不应局限于仅做一个Whisper GUI,原因在于:首先,不同的ASR模型在特定场景下各有优势,例如中文处理能力、方言覆盖、实时流式处理或对低配设备的兼容性。一个优秀的本地ASR工具应允许用户根据需求灵活选择模型。其次,当前各模型的运行时环境高度割裂,有的基于GGML,有的使用ONNX,还有的依赖PyTorch,推理接口也不统一。OpenASR致力于整合这些碎片化的技术栈,为用户提供一个统一、便捷的多模型管理和使用平台,极大地降低了开发者和普通用户体验前沿ASR技术的门槛,提升了实际应用价值。

🛠️ 开发工具 V2EX

本地多模型语音识别工具OpenASR发布

开发者近日开源了完全本地化的语音转文字工具 OpenASR。该项目旨在解决当前本地 ASR(语音识别)工具使用门槛高、生态割裂的问题。目前市面上虽有 Qwen3-ASR、SenseVoice、FireRed 等优秀的本地 ASR 模型,但它们的推理框架(如 ggml、ONNX、PyTorch)和接口各不相同,普通用户部署成本极高。OpenASR 不仅是一个 Whisper GUI,它通过统一的底层设计,实现了多模型的一键切换与本地断网运行。该工具支持音视频转文字、实时字幕、全局语音输入,并提供 CLI 和本地 API。这一项目极大降低了本地 ASR 技术的应用门槛,为需要高隐私、多场景(如方言、低配设备、实时流式)语音转文字的开发者与创业者提供了高效的本地化解决方案。

🛠️ 开发工具 LINUX DO

macOS语音转文本自动输入工具:LLM智能纠错

该项目介绍了一款专为macOS用户开发的语音转文本自动输入工具。它创新性地结合了macOS系统自带的语音模型进行初步的语音识别,并进一步利用大型语言模型(LLM)对识别出的文本进行智能纠错,显著提升了输入准确性。此工具的核心亮点在于其自动输入功能和低延迟表现,通常能在1.5秒内完成整个转换及输入过程,具体速度取决于所使用的LLM API性能。项目代码已完全开源,托管于GitHub (uk0/typeformic),鼓励开发者社区参与贡献和改进。对于需要高效文本输入,尤其是依赖语音输入且对准确性有高要求的macOS开发者和用户而言,这款工具提供了一个结合本地AI与云端LLM优势的实用解决方案。