資金調達
コンターが700万ドルの資金を調達してセキュリティカメラを検索エンジンに変える

Conntour は、General Catalyst、Y Combinator、SV Angel、および Liquid 2 Ventures を含む投資家から 700 万ドルのシードラウンドを調達してステルスモードから脱出しました。この会社は、セキュリティチームが Web を検索するのと同じようにビデオ フッテージを検索できるという、シンプルながら野心的なアイデアを中心に据えています。
このプラットフォームは、カメラ ネットワーク全体で自然言語クエリを導入し、ユーザーが事前に定義されたフィルターやカテゴリに頼るのではなく、探しているものを説明できるようにします。
パッシブ カメラから検索可能なインテリジェンスへ
従来のビデオ監視システムは、厳格なルールに基づいて構築されています。オペレーターは、事前に特定のオブジェクト、動き、または行動を検出する必要があります。このアプローチは、予期しないことが起こったときに、多くの事例を逃し、手動でレビューするのに数時間を要することがよくあります。
Conntour は、このモデルをより柔軟なインターフェイスに置き換えます。事前にアラートを設定するのではなく、ユーザーは「放置されたバッグを持った人物」または「昨日の荷物積み下ろしエリア近くのバン」というようなクエリを入力し、システムは関連するフッテージを取得します。
これは、監視から検索へのシフトを表しています。ビデオは、見るものではなく、要求に応じて探索および調査できるものになります。
現実世界の複雑さに対応するように構築
監視の1つの核心的な課題は、現実世界の状況がほとんどの場合、整ったカテゴリに収まらないことです。疑わしい行動は、単一の検出可能なオブジェクトではなく、行動のシーケンスを伴うことがよくあります。
Conntour のシステムは、この曖昧さを処理するように設計されています。リアルタイムのアラートと迅速な事後調査の両方を可能にするため、リアルタイム フィードと歴史的なフッテージの両方で動作します。また、既存のカメラ インフラストラクチャと互換性があり、完全にオンプレミスで展開できるため、データがセキュア ネットワークを離れることができない環境では重要です。
インターフェイスは、検出ルールを設定したり、基礎となるモデルを理解したりする必要なく、非技術的なオペレーターが複雑なシステムと対話できるように設計されています。
ハイステークス環境での初期トラクション
この会社は、シンガポールの国家安全保障作戦にすでに展開されており、精度と速度が重要な環境での早期採用を示唆しています。
創設者のチームのインテリジェンスとハイテク システムのバックグラウンドは、特に運用効率性への焦点という点で、製品の設計に影響を与えているようです。このプラットフォームは、1人のオペレーターが数千台のカメラを監視し、事例の調査に必要な時間を大幅に削減できることを主張しています。
従来のビデオ分析システムと比較して、プラットフォームは次のような運用上の改善を報告しています。
- 手動ビデオレビュー時間が最大 90% 削減
- 逃したイベントが最大 80% 少ない
- 誤検知が最大 70% 削減
- 1 人のオペレーターが数千台のカメラを監視できる
これらの改善は、ルールベースのワークフローを、コンテキストと意図をより動的に解釈するシステムに置き換えることから生じます。
このテクノロジーが導くところ
Conntour が構築しているものは、ビデオ データの解釈方法のより広範なシフトを示唆しています。より速い分析だけではなく、根本的に異なるインタラクション モデルです。事前に定義された検出ルールを中心にシステムを設計するのではなく、自然言語で表現された意図を理解することへの負担が移ります。
そのシフトは、セキュリティ以外の分野にも影響を及ぼします。「物を残した人物」または「入り口近くの異常な動き」などのオープンエンド クエリを信頼性高く解釈できるシステムは、コンテキスト、関係、シーケンスが個々のオブジェクトと同じくらい重要になる、セマンティック ビデオ理解への移行を示唆しています。
大規模にすると、これは組織がビデオ アーカイブを使用する方法を変える可能性があります。フッテージは、動的に検索できるインデックス化されたデータセットになり、受動的に保存されるのではなく、輸送ハブ、ロジスティクス ネットワーク、公共インフラストラクチャなどの環境では、事例の再構築、監査、潜在的な予測が変化する可能性があります。
検出から理解への下地
従来のシステムは、特定のカテゴリ (人や車両など) を認識するようにトレーニングされたオブジェクト検出モデルに依存しています。制御されたシナリオでは効果的ですが、これらのモデルは、クエリが事前に定義されたラベル外にある場合に苦労することがよくあります。
Conntour のアプローチは、おそらく、オブジェクトだけでなく、属性、関係、時間の経過を捉える、豊富な視覚的表現 (エンベディングと呼ばれる) を構築することから始まるでしょう。自然言語クエリは、視覚データと同じ表現空間にマッピングできます。システムは、意図と視覚データを一致させることができます。
別の重要な課題は、時間的推論です。多くの現実世界のクエリは、単一のフレームではなく、イベントのシーケンスを伴います。時間を通じてエンティティを追跡し、単独のオブジェクトの識別だけでなく、相互作用を理解することが必要です。
制約とトレードオフ
このタイプのシステムには、潜在的な利点がありますが、新しい課題も導入します。高度なモデルを使用した大量のビデオの処理は、特にリソースが制約されるオンプレミス展開では、計算コストが高くなります。
精度も考慮すべき点です。オープンエンド クエリは曖昧さを導入し、システムは柔軟性と精度のバランスを取る必要があり、誤陽性や検出漏れを避ける必要があります。ルールベースのシステムとは異なり、自然言語駆動型システムは、エッジ ケースに一般化するモデルの品質に大きく依存します。
また、ガバナンスの影響もあります。特定の属性または行動を検索する機能は、監視、アクセス制御、および特に機密または公共の環境における適切な使用に関する質問を引き起こします。
Conntour の立ち上げは、厳格なルールベースの監視から、リアルタイムで意図とコンテキストを解釈できるシステムへの移行を強調しています。
このモデルが信頼性が証明されれば、組織がビデオ データとやり取りする方法を再定義する可能性があります。受動的な監視から、ダイナミックでクエリ駆動型のインテリジェンスへの移行となります。












