mlsubgenは動画の字幕を37言語で自宅のGPUだけで作るOSS、タイ在住の個人が公開
タイ在住の個人開発者が、動画フォルダを指定するだけで字幕ファイルを作るOSS「mlsubgen」を公開した。音声認識2種とローカルLLMの翻訳を組み合わせ、37言語の字幕を出す。8GBのNVIDIA製GPUから動き、映像も字幕も外部に送らない。
出典:GitHub(dodgypast)・Reddit r/LocalLLaMA
文字起こしに関する海外の最新ニュース3本を日本語でまとめています。公式発表・論文・海外メディアの報道をもとに、ビジネスへの影響まで解説します。
タイ在住の個人開発者が、動画フォルダを指定するだけで字幕ファイルを作るOSS「mlsubgen」を公開した。音声認識2種とローカルLLMの翻訳を組み合わせ、37言語の字幕を出す。8GBのNVIDIA製GPUから動き、映像も字幕も外部に送らない。
出典:GitHub(dodgypast)・Reddit r/LocalLLaMA
Microsoft AIが逐次文字起こしのMAI-Transcribe-2-Streamingと音声合成のMAI-Voice-2.1・2.1-Flashを公開した。文字起こしは60言語で年末まで1時間$0.54。音声合成は23言語だが、現時点で日本語の音声はない。
出典:Microsoft AI・Microsoft Learn・X @MicrosoftAI
スペインのLokutorが、マイコンESP32-S3だけで英語を文字起こしするオープンソースの音声認識「Oído」を公開した。LibriSpeechの単語誤り率は3.7%で、ノートPCで動かしたWhisper tiny.enの6.3%を下回ると公表している。
出典:GitHub lokutor-ai・Hugging Face lokutor-ai・Hacker News