探索 Python 项目
筛选并发现收录的、配有高质量中文文档或教程的 GitHub 项目。
基于音频驱动的口型同步系统,用于编辑真实世界说话人视频。通过表情归一化、唇部同步和面部增强三步流程,生成高质量、口型匹配的视频,支持多种表情控制。
提供目标检测脚本与改进思路,涵盖YOLO系列(v8/v10/v11/v12)及RT-DETR的模型改进、剪枝与知识蒸馏方案,支持多种任务与部署优化。
用于合并预训练大语言模型的工具集。支持多种合并算法,可在 CPU 或低显存 GPU 上运行,支持 Llama、Mistral 等模型。提供 YAML 配置、LoRA 提取、专家混合合并等高级功能。
基于 Python 的 3D 视觉几何模型,通过单目或双目图像轻松重建 3D 场景。支持多种分辨率与预训练模型,提供交互式演示与 Docker 部署选项。
基于注意力汇点机制,实现无限长度输入的高效流式 LLM 推理框架。支持 Llama-2、MPT 等模型,无需微调即可处理超长序列,性能稳定。
InternLM 系列开源大模型,涵盖 InternLM、InternLM2、InternLM2.5 和 InternLM3。最新 InternLM3-8B-Instruct 以 4 万亿高质量 token 训练,成本降低超 75%,在推理与知识密集型任务上性能领先,支持深度思考与流畅对话模式。
Python 3.8-3.12 及 PyPy 的子进程替代库,允许像调用函数一样执行任何程序。基于 Unix 系统调用,支持 Linux、macOS、BSD 等系统。
全面系统的推荐系统入门教程,涵盖理论基础、核心算法、工程实践与面试准备。提供从理论学习到实战应用的完整闭环,包含召回、精排、重排模型及前沿技术研究。
轻量级库,用于将复杂对象与简单Python数据类型相互转换。支持验证、反序列化和序列化,适用于HTTP API等场景。
LLM 评估平台,支持 Llama3、Mistral、InternLM2、GPT-4 等多种模型及 100+ 数据集。提供强大算法与直观界面,助力高效评估 NLP 模型质量与效果。
基于超过 200k 小时多语言语音数据训练的开源权重 TTS 模型,提供媲美顶级供应商的表达力与质量。支持零样本语音克隆,仅需 10-30 秒参考音频即可生成高质量语音。具备多语言支持(英、日、中、法、德)及细粒度音频控制(语速、音调、情感),输出原生 44kHz 音频。提供 Gradio WebUI 和 Docker 部署,RTX 4090 上实时因子约 2x。
将 Jupyter Notebook 转为纯文本格式(如 .py 或 .md),便于版本控制和 IDE 编辑。支持配对笔记本,保留输出并实现双向同步。
Celery 分布式任务队列的实时监控与 Web 管理面板。提供任务状态、进度、历史记录查看,支持远程控制 Worker(如重启、调整池大小)、队列监控、OAuth 认证及 Prometheus 集成。
为大型语言模型添加安全护栏的 Python 框架。通过输入/输出守卫检测并缓解特定风险,支持从 LLM 生成结构化数据。提供丰富的验证器库,可组合成守卫以拦截模型输入输出。
专为人类设计的 SQL 库。支持 RedShift、Postgres、MySQL、SQLite、Oracle 和 MS-SQL。提供优雅接口处理查询结果,支持参数化查询、事务、批量操作及 CSV、JSON、Excel 等多种格式导出。
一键模型解放 + 聊天沙盒。通过机械可解释性技术,精准移除大语言模型的拒绝机制,保留核心能力。支持 HuggingFace Spaces 和 Colab 免安装运行。
构建本地语音代理的开源管道。集成 VAD、STT、LLM、TTS 四模块,可通过 WebSocket API 以 OpenAI 兼容协议运行。各组件可替换,支持本地或云端 LLM,实现全开源、低延迟的语音对话栈。
Python 库,用于 Docker Engine API。支持运行、管理容器和 Swarm,功能与 docker 命令等效。通过 pip 安装,从环境配置连接。
Python 脚本,可直接从 Apple 下载 macOS 组件。支持在 Windows 上使用 dd 和 7zip 构建互联网恢复 USB 安装器。注意:macOS 11 (Big Sur) 及以上版本不再支持通过 MakeInstall 构建 USB。
Binance 交易所 API 的 Python 非官方封装库,支持自动化交易。提供完整的 REST API 实现、异步支持、WebSocket 处理、现货、期货、期权及保证金交易,并具备代理、测试网和多种认证方式。
提供 Stable Diffusion 等图像生成模型的训练、生成与实用脚本。支持 LoRA、微调、Textual Inversion 等多种训练方式,涵盖 SD1.x/2.x、SDXL、SD3/SD3.5、FLUX.1、LUMINA、HunyuanImage-2.1 等模型。包含 Windows/Linux 安装指南与详细文档。
全功能 WebUI,支持 AI 生成图像与视频、字幕及处理。多平台兼容,包括 nVidia CUDA、AMD ROCm、Intel Arc、DirectML、OpenVINO 等。内置模型编译与量化优化,支持 150+ OpenCLiP 和 20+ VLM 模型进行交互/字幕处理。
从单张图像重建完整 3D 形状、纹理与布局,通过渐进式训练和人类反馈数据引擎,擅长处理遮挡和杂乱的真实场景,在真实物体和场景的人类偏好测试中优于先前模型。
实时高分辨率背景抠像。基于 PyTorch,支持 4K 30fps 与 HD 60fps 实时处理。提供预训练模型、数据集及多种推理脚本,适用于图像与视频。