探索 Python 项目
筛选并发现收录的、配有高质量中文文档或教程的 GitHub 项目。
探索基于深度学习的文本分类方法,支持多标签分类。包含 fastText、TextCNN、BERT、TextRNN、RCNN、Hierarchical Attention Network、Seq2seq、Transformer、Dynamic Memory Network、EntityNetwork 等多种经典与前沿模型。提供大规模中文语料与预训练模型,支持快速部署 NLP API。
🚀🎬 AI 框架,用于自动化 YouTube Shorts / TikTok 频道内容创作。支持多语言语音合成、视频剪辑、素材获取与字幕生成,基于 Python 构建。
开源实现微软 VALL-E X 零样本 TTS 模型。支持多语言语音合成(英、中、日)与零样本人声克隆,仅需 3-10 秒音频即可复刻任意说话人声音。提供预训练模型与在线演示。
扫描、索引并归档所有纸质文档。基于 Python 开发,支持 OCR 识别与数据库索引,提供 Web 前端。项目已归档,建议关注其活跃分支 Paperless-ng。
提供 Fast Stable Diffusion + DreamBooth 的 Colab 笔记本,支持 ComfyUI、A1111 和 DreamBooth 训练,优化性能与易用性。
基于条件变分自编码器与对抗学习的端到端文本到语音合成系统,支持单阶段训练与并行采样。引入归一化流与随机时长预测器,实现自然的多对一映射,生成具有多样韵律的语音。在 LJ Speech 数据集上 MOS 评分接近真实语音。
OpenMMLab 姿态估计工具箱与基准。支持 2D/3D 人体、手部、面部、全身、动物等多种姿态估计任务。基于 PyTorch,提供丰富模型库与高效训练推理。
基于 Python 的全栈股票系统,使用 pandas、akshare、bokeh 和 tornado 等框架。支持 Docker 部署,通过 akshare 抓取数据并存储于 MySQL。提供每日数据计算、17 个技术指标分析(如 KDJ、RSI、MACD)及可视化图表,前端采用 Vue 开发。
斯坦福大学官方 NLP Python 库,支持 60+ 种语言的分词、句子分割、NER 和解析。提供生物医学和临床模型,可无缝处理文献与临床文本。
基于 Web 的 Stable Diffusion 图像生成界面,支持多种采样器、图像增强与放大、文本反转训练及提示词权重控制。提供 Streamlit 与 Gradio 双界面,优化 VRAM 使用,支持 Windows 与 Linux 安装。
基于 PaLM 架构实现 RLHF(人类反馈强化学习),类似 ChatGPT。支持奖励模型训练与 PPO 优化,使用 PyTorch 开发。
提供针对 gpt-5.6-sol 的越狱提示词与测试包,提升 Codex 连续执行复杂指令能力。涵盖安全研究、渗透测试等,使用 Python 脚本部署,版本迭代优化。
基于 Apple MLX 框架的音频处理库,为 Apple Silicon 提供高效的文本转语音、语音转文本和语音转语音功能。支持多种模型架构、多语言、语音克隆和量化优化,提供命令行工具、Python API 和 Web 界面。
纯 PyTorch 实现的 Faster R-CNN,支持多 GPU 训练、多图像批次及 ROI Pooling/Align/Crop 三种池化方法,内存高效且训练速度快。
纯 Python 实现的 MySQL 和 MariaDB 客户端库,遵循 PEP 249 标准。支持 Python 3.9+ 和 PyPy,兼容 MySQL 和 MariaDB LTS 版本。提供 pip 安装,可选 RSA 和 ed25519 认证支持。
跨平台 GUI 工具,用于在系统中查找重复文件。主要使用 Python 3 编写,基于 Qt 框架。支持 Linux、macOS 和 Windows。
利用 BERT 和 c-TF-IDF 创建易于解释的主题,支持多种主题建模技术,包括引导式、监督式、半监督式、手动、多主题分布、层次化、基于类别、动态、在线/增量、多模态、多方面、文本生成/LLM、零样本、合并模型和种子词。
本地化数据摄取与解析平台,支持文档、多媒体及网页等约 20 种格式,转换为高质量结构化 Markdown,优化 GenAI 兼容性。完全离线运行,适配 T4 GPU,支持 Docker 部署与 Gradio 交互界面。
基于 Blender 的 Python 脚本,通过随机种子程序化生成 3D 飞船模型。支持自定义参数调整,可生成无限舰队。
统一 Text-to-Video、Image-to-Video 和 Video-Continuation 的视频生成模型。高效生成长视频,几分钟内输出 720p 30fps 视频。多奖励 RLHF 提升性能。Avatar 1.5 支持音频驱动动画。
支持图像到视频和视频到视频生成的无限长度对话视频生成模型。具备稀疏帧视频配音能力,可同步唇部、头部、身体和表情,实现高精度口型同步与身份保持。
系统讲解算法与数据结构的中文学习手册,包含 200 道高频面试题和 1000+ 道 LeetCode 题解,支持在线阅读与 PDF 下载。
由 Stability AI 的 DeepFloyd Lab 开发的开源文本到图像生成模型。采用模块化级联扩散架构,包含基础模型和两个超分辨率模型,支持最高 1024x1024 像素图像生成。基于 T5 文本编码器与增强的 UNet 架构,具备高保真度和语言理解能力,在 COCO 数据集上实现 6.66 的零样本 FID 分数。
通过字幕剪切视频,自动生成字幕,编辑文本即可裁剪片段,无需视频编辑软件。支持多种 Whisper 模型,包括 faster-whisper 和 OpenAI API,可 GPU 加速。提供 pip 安装和 Docker 部署,支持本地及远程处理。