Adobe Fireflyレビュー:新たに搭載された3つのAI搭載オーディオツールは果たして使えるのか?
Adobe FireflyのAI搭載オーディオツール3種類をテストしました。その効果と、ビジネスで試してみる価値があるかどうかを検証します。
知っておくべき最も重要なこと
- Generate Musicは、これらのツールの中で「真の勝者」と言えるでしょう。初期段階ではまずまずの出来栄えの楽曲を生成し、ムード、スタイル、目的、エネルギーレベルなどを正確に定義するテキストコマンドを使用することで、劇的にクオリティが向上します。
- サウンドエフェクト生成ツールは非常に便利で、正確な手動テキストコマンドが必要であり、タイムライン上で複数のオーディオトラックを追加し、その位置とレベルを制御することができます。
- Generate Speech 45は、話者に一時停止制御オプションを提供します。これは、マーケターやコンテンツクリエイターが日々のビデオ制作を効率化するのに役立ちますが、プロの声優によるナレーションに取って代わるものではありません。
- Adobeが3つの新しいオーディオツールを発表 人工知能を使って Fireflyの中で
- クリエイターは、音楽生成、音声生成、効果音生成機能を利用できるようになりました。
- 動画制作でどのように機能するかを確認するためにテストしてみました。
ベータテスト期間を経て、Adobe FireflyはAIを活用した3つの新しいオーディオツールをリリースしました。「スタジオ品質のサウンド」を謳い、すべてのクリエイターが利用できるとしています。私はそれぞれのツールをテストし、その性能が宣伝通りかどうかを検証しました。結果として、いくつかの小さな問題点はあったものの、概ね期待通りの性能を発揮しました。

音楽生成、効果音生成、音声生成は、AdobeのブラウザベースのAIプラットフォームに新たに搭載されたオーディオ機能です(その機能は名前から明らかです)。
3つのツールすべてを試してみた経験から言うと、Generate Musicは群を抜いて優れています。予想をはるかに上回る出来栄えで、マーケターやクリエイターにとって非常に有益なツールだと確信しています。こちらをクリックして、ぜひご自身でお試しください。
何か新しいことはありますか?
3つのAIツールが誰でも利用できるようになりました。その機能は概ね説明不要ですが、知っておくべきことは以下のとおりです。
- 音楽を生成する この機能を使えば、動画の長さや雰囲気に合ったライセンス取得済みの音楽トラックを作成できます。
- 音声を生成する 書かれたテキストは音声解説に変換されます。
- 効果音を生成する ご想像のとおり、動画の動きやタイミングに合わせた効果音を生成します。
しかし、本当にそれほど良いものなのだろうか?
私は以前、人工知能全般に対する懐疑的な見方と、創作活動における人工知能の利用に対する懸念について書いたことがある。それは単なる芸術の模倣に過ぎない。
しかし、Adobeのツールは、私のチームの中で最も熱心なAI懐疑論者でさえ感銘を受けさせた。特に、ビデオ編集ソフトウェアのGenerative Extendのような機能は印象的だった。そして私は偏見のない人間なので、これらのツールを実際に試してみて、その真価を確かめることにした。
少なくとも当面の間は、マーケターとコンテンツクリエイターの両方にとって、クリエイティブなワークフローを加速させることに重点が置かれている。
人工知能で音楽を制作する

まず、 Generate Musicツールを使ってみました。このツールでは、テキストコマンドを自由に入力したり、ビデオクリップをアップロードしたりすることができ、AIが希望する音楽の種類を推測してくれます。今回は、以前reMarkable Paper Pureのレビュー用に録音した27秒の短いクリップを使用しました(ダウンロードフォルダに残っていたためです)。
これに基づき、Fireflyは「製品紹介のための、穏やかで深みのあるアンビエントな電子音楽」を作成するためのスクリプトコマンドを提案した。
「生成」ボタンを押すと、数秒後(そのスピードは本当に驚くべきものだった)、それぞれ異なるものの同じような雰囲気を持つ4つのトラックが表示された。それらは…まあまあだった。ややありきたりではあるが、緊急時やプロジェクトを素早く仕上げたい場合には役立つかもしれない。(音楽業界におけるAIの影響について詳しくは、Apple MusicがアーティストにAI音楽へのタグ付けを義務付けているという記事をご覧ください。)
スクリプトコマンドに「jazz」や「cinematic」といった用語を追加し、「vlog」や「trailer」で使用できるようにしました。「Energy」の設定を「low」から「medium」に変更しました。結果は格段に良くなりました。
他のAIツールと同様に、テキストコマンドの精度が高いほど、出力結果も良くなります。また、具体的なイメージがある場合は、雰囲気、スタイル、目的などを自分で記述することも可能です。
ここから音楽とビデオ、または音楽だけをダウンロードできます。
AIによる音声生成

次に音声生成ツールに移ります。まず、サイドバーを使って使用するAIモデルを選択しました。この記事執筆時点では、Adobeの商用利用にも安全なFireflyモデルと、パートナーであるElevenLabsのMultilingual V2モデルが利用可能でした。
次に、45人の候補者の中から講演者を選んだ。それぞれの候補者は、男性、女性、ノンバイナリー、若年、中年、高齢など、様々な形で説明されていた。
最後に、テキストフィールドに自分のテキストを貼り付けました。Fireflyは私が使用している言語を自動的に検出できますが、自分で選択することも可能です。私は「オジマンディアス」という詩を使用しました(シェリーには心からお詫び申し上げます)。
ここで気に入ったのは、テキストを入力した後、追加のテキストを入力したり、AIに特定の場所で停止するように指示したりできる点です。
実際に音声をプレビューするには、クリップ全体を選択してコンテキストメニューを使用する必要がありました。コンテキストメニューでは、発音を修正したり、声のトーンを調整したりすることもできます。
ワークフローの高速化が盛んに議論されている中で、これは間違いのように思える。画面下部にスタートボタンがあれば十分なのに。
テキストにゆとりを持たせるために一時停止間隔を調整する必要がありましたが、一度設定すれば、プレビュー画面の一時停止ボタンをクリックすることでタイミングを変更できました。どういうわけか、「land」という単語がAIを混乱させ、「lan」と発音されました。
AIを活用した効果音(SFX)の作成

今回のテストでも、以前reMarkableのレビュー用に撮影した動画を使用しました。今回は、reMarkable 2とPaper Pureを比較した12秒のクリップです。
このプロセスははるかに複雑で、AI は可能な効果音 (SFX) を推測しません。私は手動で希望を説明する必要がありました。その後、「プロンプトを強化」をクリックすると、さらに説明が追加されました。
こうして、私たちは「かすかな金属音とともに滑らかに落ちるスライド式の笛」という音にたどり着きました。「生成」をクリックすると、すぐに4種類の耳をつんざくような音のバリエーションが生成されました。その結果はお見せしません。誰にとっても公平ではありませんから。
その代わりに、動画の長さを埋めるために、12秒間の「野原でのコオロギの鳴き声」という、より静かな音声に変更された。
サウンドエフェクト(SFX)オプションの優れた点は、複数のサウンドトラックを追加し、ハンドルを使ってそれらの位置を調整できることです。
画面下部にタイムラインが表示されるので、より本格的なオーディオエディターに近い感覚で操作できます(少なくともある程度は)。ボリュームハンドルをドラッグすれば、音量を調整したり、トラックを削除したりできます。
それだけの労力をかける価値はあるのだろうか?
全体的に見て、制作ワークフローをより高速化するために、UIにいくつか改善を加えたい点があります。
プロのサウンドデザイナー、作曲家、ミュージシャンに取って代わる日がすぐに来るとは思いません。しかし、マーケティングの仕事を通して、マーケターや日常的な動画制作において、この技術が重要な役割を果たすようになるだろうと感じています。
音声技術は、マイクロソフト・サムのようなロボット音声の時代から大きく進化してきたが、正確な音声表現を求めるなら、スタジオでプロのパフォーマーに依頼するのが一番だ。
しかし、効果音(SFX)にははるかに大きな利点があります。幅広い世代にわたって、AIが生成した音と、私が所有していた古い効果音ディスクで再生された音を区別することができませんでした。
真の勝者は「音楽生成」機能だ。基本的な機能だけでも、製品デモ、レビュー、ビジネス説明など、どんな場面でも違和感のないサウンドが生成された。しかも、生成するたびに音質が向上していった。
つまり、テンポの速いビデオ制作を行う人にとっては、検討する価値のあるアップデートと言えるでしょう。
コメントは締め切りました。