探索 Python 项目
筛选并发现收录的、配有高质量中文文档或教程的 GitHub 项目。
基于 PyTorch 从零实现 Transformer,支持单 GPU 训练亿级参数 LLM,涵盖从数据下载到文本生成全流程。新增对齐后训练套件(SFT、RM、PPO、DPO、GRPO),纯 PyTorch 手写,无需 trl/peft/transformers。
基于 OCR 的生肉翻译软件,支持实时屏幕文字识别与翻译。搭载离线/在线 OCR,提供常规、在线 AI、本地 AI 等多种翻译模式。具备自动模式、账号云端同步及图片翻译功能,可处理漫画图片的识别、翻译、消字与嵌字。
基于 Python 的自动化加密货币交易机器人,专为 Binance 平台设计。采用桥接货币(如 USDT)在多种币种间进行套利交易,通过算法在强势币与弱势币之间轮换,旨在提升资产持有量。支持 Heroku 和 DigitalOcean 一键部署,提供社区交流渠道。
精选金融机器学习工具与应用集合,涵盖深度学习、强化学习等前沿技术。由 Sov.ai 支持,与顶级量化基金合作,提供实战项目与研究机会,推动投资洞察创新。
基于 PyTorch 的高分辨率(如 2048x1024)视频到视频转换实现。支持将语义标签图、边缘图或姿态图转换为逼真视频,核心基于图像到图像转换。
基于 Transformer 的可扩展扩散模型官方 PyTorch 实现。提供预训练模型、采样与训练代码,支持 ImageNet 256x256 和 512x512 生成。
基于高斯过程的全局优化 Python 库,适用于高成本函数,平衡探索与利用,支持约束优化。
Ferret 是一个端到端多模态大语言模型,支持任意形式的指代与细粒度定位。核心贡献包括混合区域表示与空间感知视觉采样器,以及大规模分层指令数据集 GRIT。项目提供 7B 与 13B 模型权重、训练脚本及评估基准。
现代 Python 包与依赖管理器,支持最新 PEP 标准。提供快速依赖解析、PEP 517 构建后端、PEP 621 项目元数据、灵活插件系统及集中式安装缓存。可管理虚拟环境,兼容 pyproject.toml 与 lockfile。
基于 Docker / 青龙面板 / 群晖的每日签到脚本,支持多账号。集成爱奇艺、Bilibili、阿里云盘等平台签到,提供多种通知方式。
基于音频驱动的人像动画生成工具,支持分层视觉合成,可将静态肖像转化为动态视频。提供模型训练代码、HuggingFace 演示及多种社区集成。
CLI 工具和 Python 库,将常用命令行工具、文件类型和字符串输出转换为 JSON、YAML 或字典,便于管道处理和自动化脚本。
在 Linux 上运行 Windows 软件和游戏。基于 Python 开发,提供 Flatpak 安装方式,支持 Wine 环境管理。
基于 Python 的 PostgreSQL 高可用模板,支持 Etcd、Consul、ZooKeeper 或 Kubernetes 作为分布式配置存储。适用于数据库工程师和 DevOps 快速部署 HA 集群,兼容 PostgreSQL 9.3 至 18 版本。
LLM 漏洞扫描工具,用于检测生成式 AI 的幻觉、数据泄露、提示注入、误导信息、毒性生成及越狱等弱点。支持多种 LLM 接口,如 Hugging Face、OpenAI、AWS Bedrock 等。
高效高分辨率图像与视频生成框架,基于线性扩散 Transformer,提供完整训练与推理管线,支持 SANA、SANA-1.5、SANA-Sprint 及 SANA-Video。
实时高精度全身多人姿态估计与跟踪系统。支持COCO、MPII等数据集,提供PoseFlow在线跟踪器,性能领先。兼容Linux与Windows,提供Colab快速启动。
支持 600+ 语言的高质量语音克隆 TTS,基于扩散语言模型架构,实现极速推理与精细控制。提供语音克隆、语音设计及非语言符号支持,可通过 Python API 或命令行工具快速使用。
Python 客户端,用于百度云/百度网盘。支持文件列表、上传、下载、同步、比较等操作。主要面向 Linux 环境(如树莓派),提供命令行界面。支持 Unicode/中文,具备失败重试、递归操作和哈希缓存功能。项目已进入维护模式,仅修复重大 Bug。
Python实现经典机器学习算法,涵盖线性回归、逻辑回归、BP神经网络、SVM、K-Means、PCA及异常检测。包含数学原理、代码实现与scikit-learn库应用示例。
基于 MoureDev 社区的编程练习路线图,支持多种编程语言,提供免费、自定进度的学习路径。包含语法、函数、数据结构等核心主题的练习与解答,以及社区贡献与排名系统。
实时交互流式数字人,支持 wav2lip、musetalk、ernerf 等多模型,实现音视频同步对话。支持声音克隆、动作编排、多并发及 WebRTC/虚拟摄像头输出。
NeurIPS 2024 单目深度估计基础模型。相比 V1,在细节与鲁棒性上显著提升,推理速度更快、参数更少、精度更高。提供多尺寸预训练模型,支持 Transformers 与 Core ML 集成。