探索 Python 项目
筛选并发现收录的、配有高质量中文文档或教程的 GitHub 项目。
基于 PyTorch 的 Vision Transformer 实现,支持多种变体如 Simple ViT、NaViT、Deep ViT 等,适用于图像分类任务,提供简洁 API 和预训练模型接口。
开源身份提供商,支持 SAML、OAuth2/OIDC、LDAP、RADIUS 等协议,适用于自托管场景,从实验室到生产集群。
一次处理长文档的 OCR 模型。支持单图、多图、PDF 解析,提供高精度识别。兼容 Transformers、vLLM 和 SGLang 推理框架,适用于复杂版面与长文本。
基于 CTranslate2 的 Whisper 转录实现,速度提升 4 倍,内存占用更低,支持 CPU/GPU 8 位量化。
连接 LLM 与 ML 社区的系统,以 LLM 为控制器,集成 HuggingFace 专家模型执行复杂 AI 任务。支持任务规划、模型选择、执行与响应生成,提供轻量级配置与云端部署选项。
PyTorch 实现的 CycleGAN 和 pix2pix,支持无配对和配对图像转换。2025 年更新支持 Python 3.11 和 PyTorch 2.4,新增 DDP 多 GPU 训练。推荐 img2img-turbo 和 CUT 以获得更快推理和更高效训练。
Python 库,通过 Yahoo! Finance API 下载市场数据。支持单个/多个股票代码、实时流数据、搜索查询及行业板块信息。提供简洁的 Pythonic 接口,适用于研究与教育。
跨平台命令行工具,基于模板快速创建项目。支持 Python 包、C 项目等,无需 Python 知识。兼容 Windows、Mac、Linux,使用 Jinja2 模板引擎。
基于 Python 和 Qt 的图形化图像标注工具,支持 PASCAL VOC、YOLO 和 CreateML 格式。已不再积极开发,推荐使用其所属的 Label Studio 社区项目。
Python 开发工作流管理工具,统一 pip、virtualenv 和 Python 解释器,支持多平台。自动生成虚拟环境和 Pipfile,提供确定性构建,通过 Pipfile.lock 确保依赖安全与一致性。
视觉指令微调框架,构建具备 GPT-4V 级别能力的多模态大语言模型。支持图像与视频理解,提供 LLaVA-NeXT 等最新模型,社区生态丰富,涵盖多种部署与评估工具。
minGPT 是 OpenAI GPT 的极简 PyTorch 重实现,专注于教育与可解释性。代码约 300 行,包含训练与推理,支持 GPT-2 模型加载与微调。
FlashAttention 是一种快速且内存高效的精确注意力实现,支持 FlashAttention、FlashAttention-2 和 FlashAttention-3。它针对 Hopper GPU (如 H100) 进行了优化,支持 FP16/BF16/FP8 数据类型,适用于 NVIDIA CUDA 和 AMD ROCm 平台。
将多个 LLM 组成“议会”,用户提问后,各模型独立生成初答,随后匿名互评并排名,最终由“主席”模型整合出最终答案。支持本地 Web 界面,通过 OpenRouter 调用多模型,便于对比评估。
Rembg 是一个移除图像背景的工具,支持 CLI、Python 库、HTTP 服务器和 Docker 容器。基于 Python 开发,拥有超过 2 万星标,提供 CPU、NVIDIA GPU 和 AMD ROCm 等多种后端安装选项。
基于 Python 的数据应用与仪表板框架,无需 JavaScript。内置 Plotly.js、React 和 Flask,支持下拉菜单、滑块等 UI 元素与 Python 分析代码直接绑定。提供丰富的图表类型与跨平台部署能力。
Python SDK 实现 Model Context Protocol,支持构建 MCP 客户端与服务器,提供 stdio、SSE 和 Streamable HTTP 传输,处理协议消息与生命周期事件。
基于 2T tokens 从零训练的代码语言模型系列,支持 1B 至 33B 多种规模。提供 16K 上下文窗口和填空任务,支持项目级代码补全与填充。在 HumanEval、MBPP 等多项基准测试中性能领先,支持 100+ 编程语言。
Python 日志库,开箱即用,无需样板代码。提供单个 logger 实例,支持文件轮转、压缩、异步、线程安全及彩色输出。兼容标准 logging,功能强大且使用简单。
基于 PyTorch 的图神经网络库,提供易用统一的 API、多种 SOTA GNN 模型、大规模图处理能力,支持多 GPU 和 torch.compile。
基于 Whisper 的高速语音识别工具,提供单词级时间戳和说话人识别。支持批量推理,速度达实时 70 倍,使用 wav2vec2 进行音素对齐,pyannote-audio 进行说话人分离。
开源插件集,专为知识工作者设计,用于 Claude Cowork。包含 11 个插件,覆盖生产力、销售、客服、产品管理、营销、法律、财务、数据分析、企业搜索、生物研究及插件管理。支持自定义工具、术语和流程,通过 MCP 连接 Slack、Notion、Jira 等外部工具,提供技能、命令和子代理,提升团队工作一致性与效率。
收录中文独立博客的列表,按 RSS 订阅量排序,支持通过 Telegram 群组讨论优化组织方式。
基于 Python 的配置框架,通过 30 个斜杠命令、16 个智能体和 7 种模式,将 Claude Code 转化为结构化开发平台。提供认知角色、开发方法论和系统化工作流自动化,支持从构思到部署的完整生命周期。
基于 LLM 的视觉-文本压缩 OCR 模型,支持图像与 PDF 高效处理,集成 vLLM 推理,提供流式输出与批量评估。
工业级可控高效零样本语音合成系统。支持自回归生成与精确时长控制,实现情感与音色解耦。通过 GPT 潜在表征与三阶段训练提升稳定性,支持多模态情感引导。