カメラ業界の次なる競争時代:競争の本質は、カメラがどれだけ理解力を持っているかにある。
カメラ業界の競争は、単なる技術仕様を超え、シーンを理解し、AIを活用したスマートな写真を撮ることに重点が置かれるようになりつつある。
知っておくべき最も重要なこと
- センサーの機能は、人間の目で美しい画像を捉えることから、機械が処理できるクリーンな信号を提供することへと変化し、知覚に不可欠なツールとなっている。
- リアルタイムAI処理におけるボトルネックはセンサーへと移行しつつあり、オンチップ処理、イベントベースセンサー、汎用シャッター、改良型HDR技術といったソリューションが、機械による読み取りやすさを向上させるために求められている。
- 次世代のカメラ業界における競争は、センサー、画像処理、周辺コンピューティングを含む統合システムを中心に展開され、従来の「画質」を超えた「推論品質」が戦略的な優先事項として重視されるようになるだろう。
私が確信するに至ったデモンストレーションは、私が自ら建てたアートギャラリーで行われた。

ガイドチームを用意できなかったので、代わりにサイドプロジェクトを開発しました。入力欄などは一切なく、スマートフォンを対象物に向けると、それが何であるかを教えてくれる仕組みでした。その後、展覧会は終了しましたが、人々はその後も使い続けました。
彼らは彼を建物や花、子供のおもちゃ、街路のポスターの方へ案内したが、それらのどれも展覧会とは何の関係もなかった。
誰からも頼まれていないのに、彼らはカメラが自分たちに世界を説明してくれるべきだと決めたのだ。
この期待に応えるのは今や業界の責任であり、人工知能がトレーニングの問題から推論の問題へと移行しつつある時期に、このような期待が高まっている。推論の問題では、ほとんどの実際の作業は、ユーザーがスマートフォンを非協力的な現実世界に向けている間に、デバイス自体で行われるようになる。
モデルがフレームに求めるものは、人間の目とは異なります。モデルは、寄りかかるための輪郭や、光が反射したりブレたりした写真でも構図を捉え直すための構造を必要とします。写真の見栄えを良くする色やコントラストは、モデルにとってはしばしば邪魔になるのです。
人間が観察するためのセンサーと、モデルが観察するためのセンサーでは、それぞれ異なる設計が必要となる。
センサーは知覚上の問題となりつつあり、リアルタイムビジョンシステムを構築する人々は、かつて写真家が抱えていたのと同じように、この問題に懸念を抱いている。
そのセンサーはどこから来たのですか?
1990年代初頭にエリック・フォッサムによって発明されたアクティブピクセルCMOSセンサーは、今日ではほぼすべての人のポケットに高性能カメラが入っている理由である。
彼の後期の研究は全く異なる方向へと進みます。それは、個々の光子を数える量子イメージセンサーです。この軌跡は、現在の人工知能の動向をよく表しています。つまり、人間が好むようなフレームを捉えることから、機械が処理するのに最適な、最もクリーンな信号を捉えることへと移行しているのです。
センサーは知覚のためのツールとなり、写真撮影はその用途の一つに過ぎない。
なぜ推論は仕事の性質を変えるのか?
推論こそが、この問題を緊急性の高いものにしている。従来、AIが主にトレーニングに重点を置いていた頃は、カメラの役割は間接的だった。つまり、後でゆったりとしたペースで分類・学習するためのデータを生成するだけだった。しかし、推論は遅いものではない。時間的制約のあるAIアプリケーションの場合のように、処理能力が低く、すでに発熱しているデバイス上で、リアルタイムで実行されるのだ。
システムがカメラが対象物に向けられている間にそれを認識し、手遅れになる前に対応する必要がある場合、最も弱い部分はモデルに至るまでのものであり、それが製品ができることすべてに制限を課すことになる。
業界の一部は未だに間違った方向に賭けている。十分な大きさのモデルがあれば、カメラから送られてくるどんな画像でもきれいに処理できるという思い込みだ。私はこの考え方が2年連続で製品開発の妨げになっているのを見てきたし、物理法則に照らし合わせても成り立たないと思う。
どのようなサイズのモデルを使っても、モーションブラーやグレアによって既に失われたディテール、あるいはモデルがフレームを認識する前に美肌優先処理によって破棄されたディテールを復元することはできません。ボトルネックは今やセンサー、そしてセンサーとモデルの間にある要素へと移行しています。
これらの機器は実際にはどのような機能を持つのでしょうか?
最近のセンサーの中には、処理の一部をチップ上で直接行うものもあり、初期計算はデータがピクセルアレイから出力される前に行われます。イベントベースのセンサー(ニューロモルフィックセンサーとも呼ばれる)は、シーンの変化部分のみを記録するため、フルフレームのストリーミングよりもリアルタイムの知覚に適しています。グローバルシャッターも、機械の読み取りを阻害する可能性のある動きの歪みを軽減するのに役立ちます。
空を劇的に表現するために長年設計されてきたハイダイナミックレンジ(HDR)でさえ、現在ではモデルが高コントラストで鮮明に読み取れる画像に合わせて再調整されている。これらの技術はそれぞれ異なるものの、すべて同じ方向、つまりモデルが処理できる世界像を目指している。
特定から結論まで
最も直感的に構築できるのはビジュアル検索です。カメラを対象物に向けると、ラベルが表示されます。しかし、スマートフォンをメニューに向ける場合、何を食べるかを決めるための手助けが必要になります。ポスターに向ける場合は、イベントをカレンダーに保存することが便利なステップとなるでしょう。物体認識はあくまで出発点に過ぎません。製品の本質は、次に何が起こるべきかを知ることにあります。ここでセンサーは、単に情報を取得するだけでなく、より長い解釈の連鎖における最初のリンクとなるのです。
カメラ製品を開発するつもりは全くありませんでした。最初は、ある展示会でガイドを雇う費用を節約するための手段として始めたのです。しかし、この小さなプロジェクトを通して、カメラ開発への本能が既に自分の中に備わっていることに気づきました。カメラ業界における次の課題は、センサー、画像処理経路、周辺機器の処理、モデルフォーマット、そして最終的にシステムが何をするのかといった、システム全体に関わるものになるでしょう。
ハードウェアメーカーは長年にわたり画質の向上に尽力してきたが、推論品質についても同様に真剣に取り組む必要がある。ソフトウェア開発者は、信号の取得を他人の問題として扱うことはできない。信号の取得方法とルーティング方法は、ユーザーが結果を見るずっと前から、その結果を左右するからだ。リアルタイム知覚の分野を深く掘り下げていくにつれ、ハードウェアとソフトウェアの従来の境界線は重要性を失っていく。
この分野にはまだスタートアップ企業にとって活躍の余地がある。彼らの強みは問題の特定スピードだ。大手企業が議論を終える前に、問題を定式化できるのだ。汎用モデルの有効性そのものが、ますます擁護しづらくなっている。問題は、単一のシステムが同じ事象を認識し、先読みし、行動できるようになった時、何が起こるのか、そして誰が最初に完全な機能を持つ製品でそれを実現するのか、ということだ。
人間の目と機械の頭脳
私の予想では、今後数年で企業は2つの陣営に分かれるだろう。人間の目で読みやすいように性能を最適化する企業と、機械が読み取る内容に合わせて性能を最適化する企業だ。しかし、ハイエンドスマートフォンにおいては、これらの目標はまだ十分に重複しているため、その違いは分かりにくい。
しかし、戦略としては、これらの目標はすでに乖離し始めている。最も持続可能な立場は、混沌とした現実世界を、機械が推論できる最もクリーンな信号へと変換できる者の立場となるだろう。
これはセンサーから始まります。
私たちは最高のカメラ付き携帯電話をレビュー、評価し、ランキング付けしました。
コメントは締め切りました。