Hacker NewsHN投稿者: toebee2026/8/22
How We Made a Text-to-Speech Model Respond in Sub-50 ms
Nari LabsがQwen3 TTSモデルの最適化手法を公開。推論速度を50ミリ秒未満に短縮し、リアルタイム性を高めるための技術的アプローチとコスト削減効果を解説している。
- •テキストから音声への変換(TTS)モデルの応答時間を50ミリ秒未満に短縮する技術が紹介されている。
- •Qwen3ベースのモデルを使用し、高速化とコスト効率の両立を実現したと報告している。
- •この技術は、より自然で遅延の少ない音声対話システムの実現に向けた重要な進歩となる可能性がある。
Hacker NewsHN投稿者: cainxinth2026/8/21
Kodak's "Pre-Invented" Lunar Orbiter Camera; Or, the Fate of SAMOS Readout
コダックが月軌道カメラの開発で果たした歴史的役割と、SAMOSプロジェクトの技術的遺産が現代の画像処理技術にどのように影響を与えたかを探求する記事
- •コダックが月探査ミッションのために開発した初期のデジタル画像読み出し技術の詳細が紹介されている
- •SAMOSプロジェクトにおける技術的課題と、その解決策が後のCCDやCMOSセンサーの発展に与えた影響が解説されている
- •歴史的な文書や技術資料に基づき、コダックの貢献が現代のコンピュータビジョンの基礎を形成した過程が描かれている
The Vergeby Charles Pulliam-Moore2026/8/21
Major YouTube creators are facing backlash for accepting AI money
HiggsfieldのSeedance 2.5機能を紹介する動画を投稿した著名な映像クリエイターらが、AI技術への過度な推奨や金銭的な動機付けをめぐり、視聴者から強い批判と反発を受けている
- •Matti HaapojaやSam Kolderら著名クリエイターがAI動画生成プラットフォームHiggsfieldの機能を宣伝した
- •彼らはSeedance 2.5を映像制作の未来として推奨する動画を投稿している
- •AI技術への依存や金銭的利益との関連性が指摘され、コミュニティから批判の声が上がっている
#画像/動画/音声生成#規制・倫理・社会影響#主要プレイヤー動向 ITmedia2026/8/21
デジタルコマースは成人向けECサイト「FANZA」で、AIを活用したコンテンツ創作・公開サービス「FANZAスタジオ」の先行体験を8月24日から開始すると発表した。
- •FANZA上でAIによるコンテンツ創作と公開を可能にする新サービスが発表された
- •先行体験は8月24日から開始される予定である
- •成人向けコンテンツ市場における生成AIの活用が本格化しつつある
Hacker NewsHN投稿者: gmays2026/8/20
Google DeepMindによる「DiffusionGemma」の技術レポートが公開された。これはGemmaアーキテクチャに拡散モデルを組み合わせたもので、テキスト生成だけでなく画像生成などのマルチモーダルなタスクにも対応する新アプローチを紹介している。
- •Gemmaアーキテクチャを拡張し、拡散モデルと統合したDiffusionGemmaの技術詳細が論文として公開
- •従来のLLMとは異なり、拡散プロセスを用いてより多様な生成タスクへの適応性を高めている
- •arXivで公開されたレポートでは、モデルの構造や訓練手法、性能評価結果が技術的に解説されている
#研究・論文#LLM/モデル動向#画像/動画/音声生成 PC Watchby 稲津 定晃2026/8/20
ボカロP向けに歌詞付きMV制作ソフト「Lyrica」が無料公開された。現時点ではmacOS版のみ提供され、追加機能を含むPROモードは有料で後日リリース予定。Windows版も準備中である。
- •歌詞付きMV制作に特化した映像編集ソフト「Lyrica」が無料公開された
- •現在はmacOS版のみ提供され、Mac App Storeからダウンロード可能
- •高解像度出力などの追加機能を含むPROモードは有料で後日提供される予定
Hacker NewsHN投稿者: simedw2026/8/20
Show HN: I trained a 125M model to autocomplete piano on-device
開発者がiPhone 15上で動作する1億2500万パラメータのTransformerモデルを公開。MIDIピアノで数音弾くだけで、デバイス内でリアルタイムに演奏を補完する仕組みだ。
- •1億2500万パラメータのTransformerモデルが、iPhone 15上で秒間約108音符の処理速度を実現した
- •コード補完ツールと同様の概念を音楽に応用し、ユーザーの入力に基づいて演奏を自動継続する
- •Core MLを活用したオンデバイス推論により、クラウド接続なしでリアルタイムの音楽生成が可能
#画像/動画/音声生成#生成AI活用・ツール#研究・論文 クラウド Watchby 三柳 英樹2026/8/20
PKSHAは複数の音声AIエンジンを一元管理・選定できるプラットフォーム「PKSHA Voice KIT」を提供開始し、音声合成の最適化を支援する
- •多様な音声AIエンジンを一つのプラットフォームで統合し、プロジェクトに最適なボイスの選定を効率化する
- •企業ユーザーが音声合成技術の導入障壁を下げ、迅速に高品質な音声コンテンツを作成できる環境を提供する
- •音声AIの活用シナリオを拡大するため、エンジン間の比較やテスト機能を備えた統合環境が構築された
ITmedia2026/8/19
立憲民主党栃木県連の男性党員が、生成AIで作成した架空の女性の画像を用いてX上で政治投稿を行い、アカウントが凍結された事例を報じる。
- •生成AIで生成された架空の人物の画像を用いて、他者に成り済ます行為が政治活動の文脈で確認された
- •該当アカウントはXプラットフォームにより凍結処分を受け、不適切な利用として処理された
- •この事件は、生成AI技術が選挙や政治議論において虚偽の情報拡散に悪用されるリスクを浮き彫りにしている
#規制・倫理・社会影響#セキュリティ・悪用#画像/動画/音声生成 PC Watchby 劉 尭2026/8/19
GoogleがGemini生成コンテンツに付与される目に見える透かし表示を、ユーザーの選択でオフにできる機能を追加した。法的義務がある国を除き順次展開される。
- •Geminiで作成した画像や動画、音楽に付く可視透かしの表示をユーザーが選択可能にする機能が実装された
- •目に見えない透かしは引き続き適用されるため、著作権や出所の追跡は可能である
- •法律で透かし表示が義務付けられている国では、このオフ機能は提供されない