2026年8月2日
KittenTTS以最小25MB的模型提供高质量文本转语音,完全在CPU上运行。了解如何使用它、其API以及它对边缘AI的重要性。
CrispASR是一个基于ggml的统一C++语音引擎,支持53个ASR和51个TTS模型,零Python依赖。通过单个CLI即可运行Cohere Transcribe、Parakeet、Voxtral、Qwen3等模型。
学习如何在2小时内以不到3美元的成本从零训练一个65M参数的视觉语言模型,包含完整代码和数据集详情。
学习如何使用geo-seo-claude技能为Claude Code审计和优化网站,以适应ChatGPT、Claude和Perplexity等AI驱动的搜索引擎。
OpenDrop 是一个用 Python 编写的命令行工具,实现了苹果 AirDrop 协议,支持通过 Wi-Fi 与 iOS 和 macOS 设备共享文件。
了解Google Gemma模型的逐层嵌入如何让一个2890万参数的语言模型完全在8美元的ESP32-S3芯片上运行,每秒生成9.5个token。
Vercel Labs的scriptc将普通TypeScript编译成小巧、快速的原生二进制文件,无需Node或V8。了解其工作原理、可编译内容以及与Go和Rust的对比。
Palmier Pro 是一款开源的、基于 Swift 原生开发的 macOS 视频编辑器,它将生成式 AI 和基于 MCP 的智能体协作直接集成到时间线中。
FluidAudio是一个Swift SDK,用于完全在设备上运行最先进的语音转文字、文字转语音、说话人分离和语音活动检测,利用Apple神经网络引擎。本文探讨了其功能、架构以及如何将其集成到你的应用中。
OpenDrop 是一个命令行工具,用 Python 实现了苹果 AirDrop 协议,支持在设备间通过 Wi-Fi 共享文件,包括与苹果设备互通。
探索SpeechRecognition,一个支持多种在线和离线语音识别引擎及API的多功能Python库,包含实用示例和故障排除技巧。
一份动手教程,教你使用PyTorch从零构建、预训练并对齐Transformer大语言模型,涵盖SFT、DPO、PPO和GRPO。