探索 Python 项目
筛选并发现收录的、配有高质量中文文档或教程的 GitHub 项目。
ComfyUI IPAdapter Plus 是 IPAdapter 模型的参考实现,用于强大的图像到图像条件生成。可轻松将参考图像的主体或风格迁移至生成过程,类似单图 LoRA。提供多种模型与示例工作流,支持 SD15 和 SDXL。
基于 YOLO3 和 CRNN 实现中文自然场景文字检测与识别。支持多种文字方向检测、不定长 OCR 训练(英文/中英文)、模型转换(PyTorch/Keras/Darknet)及结构化数据识别(如身份证、火车票)。提供 GPU/CPU 部署方案与 Web 服务。
提供 TCM 实用道德黑客课程的资源集合。包含实验室设置、网络复习、漏洞利用开发、Active Directory 攻击和 Web 应用测试等工具与指南。
基于注意力机制的无监督图像到图像翻译框架,采用自适应层-实例归一化 (AdaLIN) 实现风格转换,支持自定义数据集训练与预训练模型测试。
基于 kohya-ss 训练器的 SD-Trainer,提供 LoRA & Dreambooth 训练脚本与 GUI。支持一键训练环境,集成 TensorBoard、标签编辑器等工具,简化扩散模型训练流程。
通过miot-spec协议自动将小米设备接入Home Assistant,支持Wi-Fi、BLE、ZigBee设备,无需配置YAML,通过Web UI轻松集成。
云原生 SIEM,提供企业级智能安全分析。包含开箱即用的检测、狩猎查询、工作簿和剧本。支持 Microsoft 365 Defender 高级狩猎,欢迎贡献。
轻量高效的双语文本到语音合成,支持中英混读与口音控制。基于扩散 Transformer,参数仅 0.45B,提供超高质量语音克隆。
Python 在线机器学习库,提供流式数据处理能力。支持线性模型、决策树、异常检测等多种算法,具备特征提取、预处理和模型验证等实用工具。
基于 Unicorn 的高级二进制仿真框架,支持多平台、多架构与多种文件格式。提供可配置沙箱、细粒度插桩与跨架构调试能力,内置反向调试器,支持动态热补丁。
基于nanoGPT的LLaMA语言模型实现,支持Flash Attention、Int8/GPTQ 4bit量化、LoRA和LLaMA-Adapter微调及预训练。Apache 2.0许可,代码简洁高效,适用于消费级硬件。
基于 Flask 的可扩展管理界面框架,支持 SQLAlchemy、MongoEngine 等 ORM,提供开箱即用的 CRUD 视图和文件管理,高度灵活可定制。
基于大语言模型的树状思维框架,实现深思熟虑的问题求解。支持 BFS/DFS 搜索算法,可自定义任务与提示,用于游戏、填字等复杂推理场景。
基于 YAML DSL 的规则引擎,用于云安全、成本优化和治理。支持 AWS、Azure、GCP,可查询、过滤并操作资源,提供无服务器函数自动部署与合规性实时执行。
基于 Python 的轻量级块扩散模型,用于推测性解码,支持高效并行草稿生成。兼容多种主流大语言模型,如 Gemma、Qwen、Llama 等,并提供 vLLM、SGLang 等后端安装选项。
基于中文法律知识的开源大语言模型,通过法律领域词表扩充、大规模法律语料预训练及指令精调,增强法律语义理解与对话问答能力,提供模型与数据集。
使用多种形状和大小的图像(如圆形、线条、乐高、Minecraft方块)构建新图像。支持自定义颜色深度、缩放、重叠和多进程渲染,可生成独特马赛克效果。
基于音频条件的潜在扩散模型,端到端实现唇形同步,无需中间运动表示。直接利用 Stable Diffusion 建模复杂视听关联,支持 512×512 分辨率视频,显著改善模糊问题。
GPT 相关开源项目合集,涵盖镜像、增强、插件、工具及平替机器人等 170+ 项目,每日自动更新点赞数,助力开发者与爱好者探索 GPT 生态。
实时转录工具,同步显示麦克风输入(你)和扬声器输出(对方)的文本。支持本地 Whisper 模型或 OpenAI API 提升速度与多语言能力,需 Windows 系统及 FFmpeg。
NeRF 的 PyTorch 实现,复现论文结果且速度提升 1.3 倍。支持 lego 和 fern 等数据集训练与测试,提供预训练模型。
提供对 Google NotebookLM 的编程访问,支持 CLI 命令行、MCP 服务器和 AI 代理技能。可执行笔记本管理、来源添加、播客生成、共享及批量操作,兼容 Claude、Gemini 等多种 AI 工具。
基于 AI 的长篇小说生成工具,支持多章节自动衔接与伏笔管理。核心功能包括世界观构建、角色设计、情节蓝图、状态追踪、语义搜索、知识库集成及自动校对,并提供全流程 GUI 工作台。