DevPick

Hacker NewsHN投稿者: schopra909
登録で表示

Training Text-to-Image Models 3.6× Faster

Linum AIがJIT-DDTという手法を通じて、テキストから画像生成モデルの学習プロセスを従来比3.6倍に高速化する技術的詳細を解説している

  • •JIT-DDTという最適化手法を用いることで、画像生成モデルの学習時間を大幅に短縮できる
  • •従来の学習パイプラインと比較して3.6倍の高速化効果が得られると報告されている
  • •同社のフィールドノートとして公開されており、具体的な実装や技術的な背景が記載されている
#画像/動画/音声生成#研究・論文#半導体・インフラ
2026/9/17

DaVinci Resolve 21.1が外部AIエージェントから操作可能になり、無音カットやBGM選定など動画編集の自動化を試した結果を報告している

  • •DaVinci Resolve Studio 21.1は、外部のAIエージェントからのAPI経由での操作に対応した
  • •音声のない区間の自動検出や削除、BGMの選定、Vimeoへのアップロードまで一連の処理をAIに代行させた
  • •従来の専用ツールと比較し、AIエージェントによる操作の柔軟性や効率性の違いが確認された
#生成AI活用・ツール#画像/動画/音声生成
2026/9/16

AWSはCDNサービスCloudFrontの動的画像変換機能に、画像の自動リサイズやフォーマット最適化、メタデータ抽出を含む4つの新機能を追加した。

  • •Webサイトやアプリで表示する画像のファイルサイズと解像度を、ユーザーのデバイス環境に合わせて自動的に最適化できる機能が強化された。
  • •画像データからEXIF情報などのメタデータを取得し、コンテンツ管理や検索機能との連携を容易にする新機能が提供される。
  • •これらの機能により、開発者はカスタムコードを書くことなく、CDN経由で配信される画像の表示性能と帯域幅効率を向上させることができる。
#半導体・インフラ#画像/動画/音声生成
2026/9/16
Hacker NewsHN投稿者: imwally
登録で表示

Apple Reference Image: A New Approach for Verified Photography

Appleが写真の改ざん検出や出所検証を可能にする「Apple Reference Image」技術を発表し、メディアの信頼性確保に向けた新たなセキュリティフレームワークを導入した

  • •撮影された写真に暗号学的な参照情報を埋め込むことで、画像がどのように編集されたかを追跡可能なメタデータを生成する
  • •生成AIによるディープフェイクや悪意ある改ざんからユーザーを守るための、エンドツーエンドの検証仕組みを提供する
  • •Appleのセキュリティブログを通じて、写真の整合性を保ちつつプライバシーを損なわない技術的アプローチが詳細に説明されている
#セキュリティ・悪用#主要プレイヤー動向#画像/動画/音声生成
2026/9/16

Googleが音声対話特化のGemini 3.8 Liveを発表し、会話の合間に推論処理や外部ツール呼び出しを並行実行できる機能を搭載した

  • •ユーザーとのリアルタイムな音声会話中に、背景で複雑な推論やAPI呼び出しを行うマルチタスク能力を備えている
  • •Extended Thinkingモードにより、より深く思考を要する質問に対する回答品質が向上する
  • •音声インターフェースとしての利便性を維持しつつ、エージェント的な動作を実現したモデルとして位置づけられている
#LLM/モデル動向#AIエージェント#画像/動画/音声生成
2026/9/16

Googleが音声対話中にツール実行や多段階推論をバックグラウンドで処理できる新モデル「Gemini 3.8 Live」シリーズを提供開始し、音声には電子透かしを埋め込む

  • •ユーザーの会話を中断させることなく、裏側でツール実行や複雑な推論処理を進めることができる
  • •一般ユーザー向け、Workspace、APIの3つのチャネルを通じて提供される
  • •生成された音声データには、AI生成であることを示す電子透かしが自動的に埋め込まれる
#LLM/モデル動向#主要プレイヤー動向#画像/動画/音声生成
2026/9/16
Hacker NewsHN投稿者: eustoria
登録で表示

Cartesian – AI 3D Modeling for Design

デザイン分野に特化したAI 3Dモデリングツール「Cartesian」が公開され、従来の手作業プロセスを代替する可能性が注目されている。

  • •Formas AIが提供するCartesianは、プロンプトや簡単な指示から3Dモデルを生成する機能を備えている
  • •デザインワークフローにおける試行錯誤の時間を短縮し、アイデアの可視化を高速化することを目的としている
  • •AIによる3D生成技術が、ゲーム開発やプロダクトデザインなど多様な業界への応用が期待されている
#画像/動画/音声生成#生成AI活用・ツール
2026/9/16
TechCrunchby Ivan Mehta
登録で表示

Former TikTok execs built an app that uses AI to teach you how to pose for a photo

元TikTok幹部が設立したアプリSuperposeは、AIでセルフ进行分析し、4つの推奨ポーズを生成して撮影を支援する

  • •ユーザーが撮影したセルフィーや写真をAIが解析し、最適な4つのポーズ提案を行うカメラアプリである
  • •元TikTokの幹部陣が開発に関与しており、SNSでの映えを意識した機能設計が特徴とされている
  • •AIを用いた画像解析技術を活用することで、ユーザーの撮影スキルに依存しない画づくりを可能にする
#生成AI活用・ツール#画像/動画/音声生成
2026/9/15
Hacker NewsHN投稿者: sankde
登録で表示

Show HN: Jexxa: High Speed on Device Dictation

Hacker Newsで公開された「Jexxa」は、外部サーバーに依存せずデバイス内で高速に文字起こしを実行できるオンデバイス音声認識ツールである

  • •「Jexxa」はネットワーク接続を必要とせず、デバイス内で高速に音声からテキストへの変換を行うオンデバイス文字起こしツールである
  • •プライバシー保護と低遅延を重視した設計で、オフライン環境でも文字起こしが可能である
  • •Hacker Newsで6ポイントを獲得し、オンデバイス推論の高速化に関する技術的関心を集めている
#生成AI活用・ツール#画像/動画/音声生成
2026/9/15
The Vergeby Andrew Liszewski
登録で表示

Voicemod’s new pocket-friendly device brings real-time voice changing to your phone

Voicemodが、ゲーム機やPCでのリアルタイム音声変換機能をスマートフォン経由でより手軽に利用可能にする新デバイス「Voicemod Key」の展開を拡大した

  • •2024年末に発売されたVoicemod Keyの機能を拡張し、XboxやPlayStationなどのコンソールゲームでの利用をよりスムーズにする設計となっている
  • •スマートフォンを単なるインターフェースとしてではなく、音声変換処理の中核的な役割を担うデバイスとして位置づけている
  • •リアルタイム音声変換技術をモバイル環境やゲーム環境に持ち込むことで、ストリーミングやゲーム内コミュニケーションの体験を向上させることを目的としている
#画像/動画/音声生成#主要プレイヤー動向
2026/9/15