2026年8月2日
KittenTTSは、わずか25MBのモデルで高品質なテキスト読み上げを実現し、完全にCPU上で動作します。使い方、API、エッジAIにとっての重要性について学びましょう。
CrispASRは、ggml上に構築された統合C++音声エンジンで、53のASRモデルと51のTTSモデルをPython依存関係なしでサポートします。Cohere Transcribe、Parakeet、Voxtral、Qwen3などを単一のCLIから実行できます。
たった2時間、3ドル未満で65MパラメータのVision-Language Modelをゼロから訓練する方法を、完全なコードとデータセットの詳細とともに学びます。
Claude Code向けgeo-seo-claudeスキルを使用して、ChatGPT、Claude、PerplexityなどのAI搭載検索エンジン向けにウェブサイトを監査・最適化する方法を学びます。
OpenDropは、Apple AirDropプロトコルを実装したPythonコマンドラインツールで、Wi-Fi経由でiOSおよびmacOSデバイスとのファイル共有を可能にします。
GoogleのGemmaモデルによるPer-Layer Embeddingsにより、28.9Mパラメータの言語モデルが8ドルのESP32-S3チップ上で完全に動作し、毎秒9.5トークンのテキスト生成を実現する方法を学びます。
Vercel Labsのscriptcは、通常のTypeScriptをNodeやV8なしで小型で高速なネイティブバイナリにコンパイルします。その仕組み、コンパイル可能なもの、GoやRustとの比較について学びましょう。
Palmier Proは、macOS向けのオープンソースでSwiftネイティブのビデオエディタであり、生成AIとMCPベースのエージェント連携をタイムラインに直接統合します。
FluidAudioは、Apple Neural Engineを使用して、最先端の音声認識、テキスト読み上げ、話者識別、音声アクティビティ検出をすべてデバイス上で実行するためのSwift SDKです。この記事では、その機能、アーキテクチャ、およびアプリへの統合方法について説明します。
OpenDropは、Apple AirDropプロトコルをPythonで実装したコマンドラインツールで、Wi-Fi経由でのデバイス間ファイル共有(Appleデバイスを含む)を可能にします。
SpeechRecognitionを探求する。これは、複数の音声認識エンジンとAPI(オンライン・オフライン両方)をサポートする多用途なPythonライブラリであり、実用的な例とトラブルシューティングのヒントを提供します。
PyTorchを使用してTransformer LLMをゼロから構築、事前訓練、調整する実践的なチュートリアル。SFT、DPO、PPO、GRPOをカバー。