SCMはMacの写真と動画の全場面を言葉で探せるOSS、AIの処理は手元で完結

3行でわかる
- SCMはMacのフォルダ内の写真と動画を、思い出した光景を言葉にして探せる、MITライセンスの無料アプリ
- SCMは動画を場面ごとに切り分けて画像モデルで索引にし、検索結果からその場面の時刻へ直接飛べる
- SCMは画像内の文字(OCR)と動画のせりふ(Whisper)でも検索でき、日本語のOCRは初期設定で有効になっている
個人開発者のAllen Lee氏が、Macの任意のフォルダにある写真と動画を、ふつうの言葉で検索できるオープンソースのアプリ「SCM(Screen Memories)」を公開しました。動画はファイル単位ではなく場面単位で探せ、検索結果を開くとその場面の時刻から再生が始まります。現地時間10月4日にHacker Newsの「Show HN」で紹介され、AIの処理はすべてMacの中で完結します。
何を作ったか
SCMとは、写真や動画の中身を画像認識のAIで数値化(埋め込み)しておき、入力した文章と意味が近いものを並べるMac用の検索アプリです。ファイル名やフォルダ分けを覚えていなくても、思い出した光景を言葉にすれば見つかる、という狙いです。ライセンスはMITで、無料で使えます。
作者がGitHubのREADME冒頭に掲げている方針は次のとおりです。
Local-first — no accounts, no cloud, no uploads. Inference runs on your Mac.
ローカル優先。アカウントもクラウドもアップロードもない。推論はあなたのMacで動く。
原文を読む(github.com)検索の方法は5つ用意されています。
| モード | 探せるもの |
|---|---|
| Files | 写真・動画を意味で検索 |
| Scenes | 動画の中の場面。時刻付きで表示 |
| OCR | 画像や動画の画面に写った文字 |
| Dialogue | 動画の中で話されたせりふ |
| LLMs(任意) | 抽出済みの文字やせりふをもとに、手元のLLMが出典付きで答える |
ほかに、スクリーンショットだけを集めるタブや、画像に写ったメールアドレスを拾うタブもあります。よく使う検索条件はタブとして保存できます。
どう作ったか
READMEによると、SCMはElectronとReactで作られ、AIの部品は既存のオープンなモデルを組み合わせています。
- 画像の理解:CLIP ViT-L/14@336(既定、約435MB)など4種類から選べる。ONNX Runtimeで動かし、軽いSigLIP-2-B/16は1枚あたり50〜100ミリ秒
- 動画の場面分け:ffmpegでカットの切れ目を検出し、場面ごとの中央のコマを索引にする。間隔は「60秒に1点」から「2.5秒に1点」まで5段階
- 文字の読み取り:Tesseract。英語は常に有効で、ほかに35言語を選べる(初期設定で中国語・日本語・韓国語が有効)
- せりふの書き起こし:Whisperの英語用モデル(tiny.en、約150MB)
- 質問応答:llama.cppで、Qwen3 1.7B(約1.1GB、メモリ8GBのMacでも動く)かLlama 3.2 3Bを使う。有効にするまでは何もダウンロードしない
モデルの重みは最初に1回だけダウンロードし、その後はオフラインで動きます。アプリはHomebrewで入れられ、Apple Silicon搭載でmacOS 12以降のMacが対象です。
反応
Hacker Newsでは、動画編集の素材探しに役立つという声が出ました。一方で、1万2,000本の動画を処理するのにどれだけ時間がかかるのかを気にする利用者がいて、CLIPで似たものを自作した別の利用者は、コマの抜き出し間隔が処理時間を決めると指摘しました。
文字の読み取りについては、Macなら標準のApple Vision frameworkの方が速くて正確だという指摘もありました。コードの書き方からAIで作ったアプリではないかと推測する書き込みもありましたが、作者はAIの利用について説明していません。
日本のビジネスへの影響
SCMはそのまま日本でも使えます。写真や動画の素材を大量に抱える広告制作やSNS運用の担当者、映像編集者にとって、「去年の展示会で製品を手に持っているカット」のような探し方ができるのは利点です。データを外部に送らないため、未公開の素材や顧客の映像でも試しやすい構成です。
まずは数百枚程度の素材フォルダで試し、どの程度の言葉で狙ったカットが出るかを確かめるのが現実的です。動画は場面分けの間隔を細かくするほど処理時間とディスク容量が増えるので、初期設定の「30秒に1点」から始めるとよいでしょう。
注意点もあります。CLIPは主に英語の文章と画像の組で学習したモデルのため、日本語で検索したときの精度はREADMEでは示されていません。せりふ検索も英語用のWhisperモデルなので、日本語の音声には向きません。日本語の会話を書き起こしたい場合は別の道具が必要です。手元で動くAIの選び方はローカルLLMのガイドにまとめています。
一次情報
- 公式サイトGitHub(allenv0)allenv0/SCM: Deep AI search for every photo and every frame of video in any folder on macOS
- 公式サイトAllen LeeSCM
- コミュニティHacker NewsShow HN: AI search for every photo and every frame of video on macOS
AIデジマは、公式発表・X投稿・論文などの一次情報を起点に、複数の情報源を照合して日本語でまとめています。情報の収集・翻訳・下書き・照合にはAIを使い、編集方針と最終責任は編集長が負います(AIの活用について)。誤りを見つけた場合は訂正のご連絡をお願いします。