ITmedia2026/9/16
DaVinci Resolve 21.1が外部AIエージェントから操作可能になり、無音カットやBGM選定など動画編集の自動化を試した結果を報告している
- •DaVinci Resolve Studio 21.1は、外部のAIエージェントからのAPI経由での操作に対応した
- •音声のない区間の自動検出や削除、BGMの選定、Vimeoへのアップロードまで一連の処理をAIに代行させた
- •従来の専用ツールと比較し、AIエージェントによる操作の柔軟性や効率性の違いが確認された
CodeZine2026/9/16
AWSはCDNサービスCloudFrontの動的画像変換機能に、画像の自動リサイズやフォーマット最適化、メタデータ抽出を含む4つの新機能を追加した。
- •Webサイトやアプリで表示する画像のファイルサイズと解像度を、ユーザーのデバイス環境に合わせて自動的に最適化できる機能が強化された。
- •画像データからEXIF情報などのメタデータを取得し、コンテンツ管理や検索機能との連携を容易にする新機能が提供される。
- •これらの機能により、開発者はカスタムコードを書くことなく、CDN経由で配信される画像の表示性能と帯域幅効率を向上させることができる。
Hacker NewsHN投稿者: imwally2026/9/16
Apple Reference Image: A New Approach for Verified Photography
Appleが写真の改ざん検出や出所検証を可能にする「Apple Reference Image」技術を発表し、メディアの信頼性確保に向けた新たなセキュリティフレームワークを導入した
- •撮影された写真に暗号学的な参照情報を埋め込むことで、画像がどのように編集されたかを追跡可能なメタデータを生成する
- •生成AIによるディープフェイクや悪意ある改ざんからユーザーを守るための、エンドツーエンドの検証仕組みを提供する
- •Appleのセキュリティブログを通じて、写真の整合性を保ちつつプライバシーを損なわない技術的アプローチが詳細に説明されている
#セキュリティ・悪用#主要プレイヤー動向#画像/動画/音声生成 gihyo.jp2026/9/16
Googleが音声対話特化のGemini 3.8 Liveを発表し、会話の合間に推論処理や外部ツール呼び出しを並行実行できる機能を搭載した
- •ユーザーとのリアルタイムな音声会話中に、背景で複雑な推論やAPI呼び出しを行うマルチタスク能力を備えている
- •Extended Thinkingモードにより、より深く思考を要する質問に対する回答品質が向上する
- •音声インターフェースとしての利便性を維持しつつ、エージェント的な動作を実現したモデルとして位置づけられている
#LLM/モデル動向#AIエージェント#画像/動画/音声生成 ITmedia AI+2026/9/16
Googleが音声対話中にツール実行や多段階推論をバックグラウンドで処理できる新モデル「Gemini 3.8 Live」シリーズを提供開始し、音声には電子透かしを埋め込む
- •ユーザーの会話を中断させることなく、裏側でツール実行や複雑な推論処理を進めることができる
- •一般ユーザー向け、Workspace、APIの3つのチャネルを通じて提供される
- •生成された音声データには、AI生成であることを示す電子透かしが自動的に埋め込まれる
#LLM/モデル動向#主要プレイヤー動向#画像/動画/音声生成 Hacker NewsHN投稿者: eustoria2026/9/16
Cartesian – AI 3D Modeling for Design
デザイン分野に特化したAI 3Dモデリングツール「Cartesian」が公開され、従来の手作業プロセスを代替する可能性が注目されている。
- •Formas AIが提供するCartesianは、プロンプトや簡単な指示から3Dモデルを生成する機能を備えている
- •デザインワークフローにおける試行錯誤の時間を短縮し、アイデアの可視化を高速化することを目的としている
- •AIによる3D生成技術が、ゲーム開発やプロダクトデザインなど多様な業界への応用が期待されている
TechCrunchby Ivan Mehta2026/9/15
Former TikTok execs built an app that uses AI to teach you how to pose for a photo
元TikTok幹部が設立したアプリSuperposeは、AIでセルフ进行分析し、4つの推奨ポーズを生成して撮影を支援する
- •ユーザーが撮影したセルフィーや写真をAIが解析し、最適な4つのポーズ提案を行うカメラアプリである
- •元TikTokの幹部陣が開発に関与しており、SNSでの映えを意識した機能設計が特徴とされている
- •AIを用いた画像解析技術を活用することで、ユーザーの撮影スキルに依存しない画づくりを可能にする
Hacker NewsHN投稿者: sankde2026/9/15
Show HN: Jexxa: High Speed on Device Dictation
Hacker Newsで公開された「Jexxa」は、外部サーバーに依存せずデバイス内で高速に文字起こしを実行できるオンデバイス音声認識ツールである
- •「Jexxa」はネットワーク接続を必要とせず、デバイス内で高速に音声からテキストへの変換を行うオンデバイス文字起こしツールである
- •プライバシー保護と低遅延を重視した設計で、オフライン環境でも文字起こしが可能である
- •Hacker Newsで6ポイントを獲得し、オンデバイス推論の高速化に関する技術的関心を集めている
The Vergeby Andrew Liszewski2026/9/15
Voicemod’s new pocket-friendly device brings real-time voice changing to your phone
Voicemodが、ゲーム機やPCでのリアルタイム音声変換機能をスマートフォン経由でより手軽に利用可能にする新デバイス「Voicemod Key」の展開を拡大した
- •2024年末に発売されたVoicemod Keyの機能を拡張し、XboxやPlayStationなどのコンソールゲームでの利用をよりスムーズにする設計となっている
- •スマートフォンを単なるインターフェースとしてではなく、音声変換処理の中核的な役割を担うデバイスとして位置づけている
- •リアルタイム音声変換技術をモバイル環境やゲーム環境に持ち込むことで、ストリーミングやゲーム内コミュニケーションの体験を向上させることを目的としている
Hacker NewsHN投稿者: arnemunthekaas2026/9/15
Show HN: An e-ink frame that hears birds and draws them as 1800s illustrations
e-inkディスプレイを備えたフレームが周囲の鳥の声を識別し、19世紀の博物画スタイルでイラストを描画するオープンソースプロジェクトが公開された
- •デバイスが環境音から鳥の種類を特定し、リアルタイムで視覚的なアートに変換する
- •描画スタイルは19世紀の古典的な鳥類イラストレーションを模したデザインを採用している
- •Hacker News上で52ポイントを記録し、AIとアート、ハードウェアを組み合わせたユニークな実装として注目を集めた