← OSS.Radar home

Powered by aegismemory.com · Aegis Memory repository

Vector Dbs And Data AI repositories

OSS Radar projects in the vector dbs and data category.

Mintplex-Labs/anything-llm

Stop renting your intelligence. Own it with AnythingLLM. Everything you need for a powerful local-first agent experience

Category
vector dbs and data
Stars
64,471
Readiness
ready (92/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +307 stars in 7 days; 77 commits in 30 days

Why it may be a gem: healthy maintenance and project fundamentals; consistent human and community activity

Strongest signals: push recency, commit activity, contributor breadth. Risks: None identified. Missing inputs: None.

Capped lower bounds: lifetime contributors, response activity.

agent-computer agent-harness agent-orchestration agentic-ai ai-agents computer-use

run-llama/llama_index

LlamaIndex is the leading document agent and OCR platform

Category
vector dbs and data
Stars
51,448
Readiness
ready (95/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +190 stars in 7 days; 29 commits in 30 days

Why it may be a gem: healthy maintenance and project fundamentals; consistent human and community activity; open issue backlog is stable or shrinking

Strongest signals: push recency, commit activity, contributor breadth. Risks: None identified. Missing inputs: None.

Capped lower bounds: lifetime contributors, response activity.

agents application data fine-tuning framework llamaindex

milvus-io/milvus

Milvus is a high-performance, cloud-native vector database built for scalable vector ANN search

Category
vector dbs and data
Stars
45,553
Readiness
ready (95/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +112 stars in 7 days; 100+ commits in 30 days

Why it may be a gem: consistent human and community activity; healthy maintenance and project fundamentals

Strongest signals: push recency, commit activity, contributor breadth. Risks: None identified. Missing inputs: None.

Capped lower bounds: 30-day commits, lifetime contributors, response activity.

anns cloud-native diskann distributed embedding-database embedding-similarity

activeloopai/deeplake

Deeplake is AI Data Runtime for Agents. It provides serverless postgres with a multimodal datalake, enabling scalable retrieval and training.

Category
vector dbs and data
Stars
9,227
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +9 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent agentic-rag ai clawbot computer-vision datalake

zilliztech/deep-searcher

Open Source Deep Research Alternative to Reason and Search on Private Data. Written in Python.

Category
vector dbs and data
Stars
8,028
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +7 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 261 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent agentic-rag claude deep-research deepseek deepseek-r1

topoteretes/cognee

Cognee is the open-source AI memory platform for agents. Give your AI agents persistent long-term memory across sessions with a self-hosted knowledge graph engine.

Category
vector dbs and data
Stars
29,849
Readiness
ready (92/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +223 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent-memory agent-skills ai ai-agents ai-memory cognitive-architecture

kestra-io/kestra

Event Driven Orchestration & Scheduling Platform for Mission Critical Applications

Category
vector dbs and data
Stars
27,575
Readiness
ready (92/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +57 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-agents automation control-plane data-engineering data-orchestration data-orchestrator

cocoindex-io/cocoindex

Incremental engine for long horizon agents 🌟 Star if you like it!

Category
vector dbs and data
Stars
11,203
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +65 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agentic-data-framework ai ai-agents change-data-capture codebase-intelligence context-engineering

vespa-engine/vespa

The AI search platform

Category
vector dbs and data
Stars
7,042
Readiness
ready (92/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +8 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai big-data java machine-learning rag search

genkit-ai/genkit

Open-source framework for building agentic apps in JavaScript, Go, Dart, and Python, built and used in production by Google

Category
vector dbs and data
Stars
6,323
Readiness
ready (92/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +17 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agents ai embedders genkit llm multimodal

HelixDB/helix-db

HelixDB is an OLTP graph-vector database built in Rust on Object Storage.

Category
vector dbs and data
Stars
5,710
Readiness
ready (90/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +20 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai cli database databases graph-database helix

reorproject/reor

Private & local AI personal knowledge management app for high entropy people.

Category
vector dbs and data
Stars
8,574
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
100/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: repository is archived, no push in 451 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai lancedb llama llamacpp local-first markdown

volcengine/MineContext

MineContext is your proactive context-aware AI partner(Context-Engineering+ChatGPT Pulse)

Category
vector dbs and data
Stars
5,459
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
15/100 · low confidence

Why: +8 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 92 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent context-engineering electron embedding-models javascript memory

pingcap/autoflow

pingcap/autoflow is a Graph RAG based and conversational knowledge base tool built with TiDB Serverless Vector Storage. Demo: https://tidb.ai

Category
vector dbs and data
Stars
2,967
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
17/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 102 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

chatbot cot graphrag knowledge-graph mysql rag

yobix-ai/extractous

Fast and efficient unstructured data extraction. Written in Rust with bindings for many languages.

Category
vector dbs and data
Stars
1,769
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +8 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 594 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-pipelines docx etl etl-pipelines extraction llm

ClaudioDrews/memory-os

A 7-layer memory operating system for Hermes Agent — persistent memory with Qdrant, structured facts, fabric recall, auto-curated wiki, and surgical context injection. Runs locally, any LLM provider.

Category
vector dbs and data
Stars
1,318
Readiness
needs review (55/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +10 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-memory context-injection docker ground-truth hermes-agent local-first

langchain4j/langchain4j

LangChain4j is an idiomatic, open-source Java library for building LLM-powered applications on the JVM. It offers a unified API over popular LLM providers and vector stores, and makes implementing too

Category
vector dbs and data
Stars
12,813
Readiness
ready (95/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +56 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

anthropic chatgpt chroma embeddings gemini gpt

LLPhant/LLPhant

LLPhant - A comprehensive PHP Generative AI Framework using OpenAI GPT 4. Inspired by Langchain

Category
vector dbs and data
Stars
1,705
Readiness
ready (84/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent autophp embeddings genai generative-ai gpt4

NirDiamant/Agent_Memory_Techniques

Agent memory for LLMs: 30 runnable Jupyter notebooks covering conversation buffers, vector stores, knowledge graphs, episodic and semantic memory, MemGPT, Mem0, Letta, Zep, Graphiti, LoCoMo benchmarks

Category
vector dbs and data
Stars
849
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +24 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent-memory ai-agents anthropic episodic-memory generative-ai graphiti

peremartra/Large-Language-Model-Notebooks-Course

Practical course about Large Language Models.

Category
vector dbs and data
Stars
1,820
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +6 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

chatbots fine-tuning-llm hf huggingface langchain large-language-models

akshata29/entaoai

Chat and Ask on your own data. Accelerator to quickly upload your own enterprise data and use OpenAI services to chat to that uploaded data and ask questions

Category
vector dbs and data
Stars
865
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 582 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

azure azure-functions azure-openai azure-webapp azureopenai chatgpt

meilisearch/meilisearch

A lightning-fast search engine API bringing AI-powered hybrid search to your sites and applications.

Category
vector dbs and data
Stars
58,902
Readiness
ready (88/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +91 stars in 7 days; 100+ commits in 30 days

Why it may be a gem: consistent human and community activity; healthy maintenance and project fundamentals

Strongest signals: push recency, commit activity, contributor breadth. Risks: None identified. Missing inputs: None.

Capped lower bounds: 30-day commits, lifetime contributors, response activity.

ai api app-search database enterprise-search faceting

qdrant/qdrant

Qdrant - High-performance, massive-scale Vector Database and Vector Search Engine for the next generation of AI. Also available in the cloud https://cloud.qdrant.io/

Category
vector dbs and data
Stars
33,835
Readiness
ready (94/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +138 stars in 7 days; 100+ commits in 30 days

Why it may be a gem: consistent human and community activity; healthy maintenance and project fundamentals

Strongest signals: push recency, commit activity, contributor breadth. Risks: None identified. Missing inputs: None.

Capped lower bounds: 30-day commits, lifetime contributors, response activity.

ai-search ai-search-engine embeddings-similarity hnsw hybrid-search image-search

lancedb/lancedb

Developer-friendly OSS embedded retrieval library for multimodal AI. Search More; Manage Less.

Category
vector dbs and data
Stars
11,088
Readiness
ready (90/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +43 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

approximate-nearest-neighbor-search image-search nearest-neighbor-search recommender-system search-engine semantic-search

oramasearch/orama

🌌 A complete search engine and RAG pipeline in your browser, server or edge network with support for full-text, vector, and hybrid search in less than 2kb.

Category
vector dbs and data
Stars
10,518
Readiness
ready (78/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +11 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

algiorithm data-structures full-text javascript node search

oceanbase/oceanbase

The Fastest Distributed Database for Transactional, Analytical, and AI Workloads.

Category
vector dbs and data
Stars
10,232
Readiness
ready (96/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics cloud-native database distributed-database fulltext fulltext-search

databendlabs/databend

Data Agent Ready Warehouse : One for Analytics, Search, AI, Python Sandbox. — rebuilt from scratch. Unified architecture on your S3.

Category
vector dbs and data
Stars
9,409
Readiness
ready (82/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai bigdata cloud-native database elasticsearch geospatial

MariaDB/server

MariaDB server is a community developed fork of MySQL server. Started by core members of the original MySQL team, MariaDB actively works with outside developers to deliver the most featureful, stable,

Category
vector dbs and data
Stars
8,057
Readiness
ready (90/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +146 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

amazon-web-services database fulltext-search galera geographical-information-system innodb

RediSearch/RediSearch

A query and indexing engine for Redis, providing secondary indexing, full-text search, vector similarity search and aggregations.

Category
vector dbs and data
Stars
6,205
Readiness
ready (81/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +8 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

fulltext geospatial gis inverted-index redis redis-module

infiniflow/infinity

The AI-native database built for LLM applications, providing incredibly fast hybrid search of dense vector, sparse vector, tensor (multi-vector), and full-text.

Category
vector dbs and data
Stars
4,663
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +7 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-native approximate-nearest-neighbor-search bm25 cpp20 cpp20-modules embedding

crate/crate

CrateDB is a distributed and scalable SQL database for storing and analyzing massive amounts of data in near real-time, even with complex queries. It is PostgreSQL-compatible, and based on Lucene.

Category
vector dbs and data
Stars
4,417
Readiness
ready (93/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics big-data cratedb database dbms distributed

neuron-core/neuron-ai

The Agentic Framework of the PHP ecosystem to build production-ready AI driven applications. Connect components (LLMs, Tools, vector DBs, memory) to agents that interact with your data and UI.

Category
vector dbs and data
Stars
2,046
Readiness
ready (93/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +8 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent agentic-ai agentic-framework agents ai llm

matrixorigin/matrixone

AI-native HTAP database with Git-for-Data and built-in vector search, serving as the data and memory backbone for intelligent agents and applications.

Category
vector dbs and data
Stars
1,874
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agents ai-native cloud-native database distributed-database distributed-systems

supervc-stack/VectorChord

Scalable, fast, and disk-friendly vector search in Postgres, the successor of pgvecto.rs.

Category
vector dbs and data
Stars
1,767
Readiness
ready (80/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +10 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

artificial-intelligence llmops postgresql vector-database vector-search

dingodb/dingo

A multi-modal vector database that supports upserts and vector queries using unified SQL (MySQL-Compatible) on structured and unstructured data, while meeting the requirements of high concurrency and

Category
vector dbs and data
Stars
1,700
Readiness
ready (77/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

embedding-search embedding-store hybrid-search key-value-distributed-store mysql-compatibility real-time-semantic-search

pixeltable/pixeltable

Unified multimodal backend for AI data apps

Category
vector dbs and data
Stars
1,608
Readiness
ready (94/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai artificial-intelligence chatbot computer-vision data-science database

datalevin/datalevin

A simple, fast and versatile Datalog database

Category
vector dbs and data
Stars
1,464
Readiness
ready (81/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +27 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-native client-server-database document-database embedded-database fulltext-search graph-database

Open-Source-Legal/OpenContracts

The open document intelligence platform for builders and hackers - DMS for the agentic world

Category
vector dbs and data
Stars
1,428
Readiness
ready (92/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +6 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent agentic-ai ai ai-agents etl etl-pipeline

milvus-io/pymilvus

Python SDK for Milvus Vector Database

Category
vector dbs and data
Stars
1,400
Readiness
ready (94/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

anns faiss faiss-vector-database milvus milvus-lite milvus-sdk

NGT-labs/NGT

Nearest Neighbor Search with Neighborhood Graph and Tree for High-dimensional Data

Category
vector dbs and data
Stars
1,369
Readiness
ready (84/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

approximate-nearest-neighbor-search k-nearest-neighbors knn-search nearest-neighbor-search nearest-neighbors vector-database

infinispan/infinispan

Infinispan is an open source data grid platform and highly scalable NoSQL cloud data store.

Category
vector dbs and data
Stars
1,343
Readiness
ready (94/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

datagrid infinispan infinispan-server inmemory-cache key-value-store nosql

qdrant/qdrant-client

Python client for Qdrant vector search engine

Category
vector dbs and data
Stars
1,342
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

qdrant vector-database vector-search vector-search-engine

endee-io/endee

Endee.io – A high-performance vector database, designed to handle up to 1B vectors on a single node, delivering significant performance gains through optimized indexing and execution. Also available i

Category
vector dbs and data
Stars
1,315
Readiness
ready (85/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +15 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-search ai-search-engine ann endee hnsw hybrid-search

kantord/SeaGOAT

local-first semantic code search engine

Category
vector dbs and data
Stars
1,302
Readiness
ready (79/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai ai-project code-search code-search-engine embeddings grep

StarlightSearch/EmbedAnything

Highly Performant, Modular, Memory Safe and Production-ready Inference, Ingestion and Indexing built in Rust 🦀

Category
vector dbs and data
Stars
1,293
Readiness
ready (78/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai cloud generative-ai hacktoberfest high-performance indexing

xerj-org/xerj

XERJ is the new way for AI to search data. Its autoindex capability activates agents to know your data without the token waste of grep and sed. One command indexes code, docs, logs and PDFs for search

Category
vector dbs and data
Stars
1,230
Readiness
ready (99/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-search ai-search-algorithms ai-search-engine ai-search-free ai-search-module ai-search-optimization

zilliztech/VectorDBBench

Benchmark for vector databases.

Category
vector dbs and data
Stars
1,156
Readiness
ready (96/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

benchmark cost-effectiveness performance vector-database vector-search vectordb

ArcadeData/arcadedb

ArcadeDB Multi-Model Database, one DBMS that supports SQL, Cypher, Gremlin, HTTP/JSON, MongoDB and Redis. ArcadeDB is a conceptual fork of OrientDB, the first Multi-Model DBMS. ArcadeDB supports Vecto

Category
vector dbs and data
Stars
1,065
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +9 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

arcadedb database dbms distributed docker document

weaviate/recipes

This repository shares end-to-end notebooks on how to use various Weaviate features and integrations!

Category
vector dbs and data
Stars
942
Readiness
ready (84/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

function-calling generative-ai llm-frameworks python retrieval-augmented-generation vector-database

verygoodplugins/automem

Long-term memory for AI assistants. Graph + vector store that recalls decisions, relationships, and context across sessions.

Category
vector dbs and data
Stars
796
Readiness
ready (81/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai ai-memory anthropic automem falkordb graph-database

skyzh/write-you-a-vector-db

A Vector Database Tutorial (over CMU-DB's BusTub system)

Category
vector dbs and data
Stars
779
Readiness
ready (74/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bustub database tutorial vector-database

neonwatty/meme-search

The open source Meme Search Engine and Finder. Free and built to self-host locally with Python, Ruby, and Docker.

Category
vector dbs and data
Stars
712
Readiness
ready (87/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai docker homelab machine-learning meme self-hosted

hhblaze/DBreeze

C# .NET NOSQL ( key value, object store embedded TextSearch SemanticSearch Vector layer ) ACID multi-paradigm database management system.

Category
vector dbs and data
Stars
577
Readiness
ready (75/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

acid android c-sharp clustering database dotnet

superlinked/VectorHub

Deprecated historical repo. Superlinked now develops SIE, a self-hosted inference engine for embeddings, reranking, OCR, extraction, and document processing.

Category
vector dbs and data
Stars
527
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai llm llmops ml mlops vector

lightonai/next-plaid

NextPlaid, ColGREP: Multi-vector search, from database to coding agents.

Category
vector dbs and data
Stars
526
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agentic-rag cli grep multi-vector vector-database

redis-developer/redis-ai-resources

✨ A curated list of awesome community resources, integrations, and examples of Redis in the AI ecosystem.

Category
vector dbs and data
Stars
480
Readiness
ready (74/100 heuristic points; not a probability)
Data confidence
medium
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +1 stars in 7 days; 21 lifetime contributors

Why it may be a gem: healthy maintenance and project fundamentals; open issue backlog is stable or shrinking

Strongest signals: push recency, contributor breadth, issue load. Risks: None identified. Missing inputs: release recency.

ai awesome-list ecosystem feature-store machine-learning redis

qdrant/qdrant-js

JavaScript/Typescript SDK for Qdrant Vector Database

Category
vector dbs and data
Stars
459
Readiness
ready (78/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +1 stars in 7 days; 16 lifetime contributors

Why it may be a gem: healthy maintenance and project fundamentals; open issue backlog is stable or shrinking

Strongest signals: push recency, contributor breadth, issue load. Risks: None identified. Missing inputs: None.

javascript sdk sdk-typescript typescript vector-database

pinecone-io/python-sdk

Official Python SDK for the Pinecone vector database

Category
vector dbs and data
Stars
447
Readiness
needs review (69/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
watch
Maintenance risk
18/100 · high confidence

Why: +1 stars in 7 days; 41 lifetime contributors

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: contributor breadth, issue load, fork interest. Risks: recent commit cadence is 0/20.0 of its monthly baseline. Missing inputs: None.

pinecone python rag sdk vector-database vector-search

treygrainger/ai-powered-search

The codebase for the book "AI-Powered Search" (Manning Publications, 2025) and associated "AI-Powered Search: Modern Retrieval for Humans & Agents" Maven course

Category
vector dbs and data
Stars
402
Readiness
ready (82/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai ai-powered-search click-models foundation-models generative-search hybrid-search

zilliztech/knowhere

Vector search engine inside Milvus, integrating FAISS, HNSW, DiskANN.

Category
vector dbs and data
Stars
377
Readiness
ready (99/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

faiss gpu hnsw nearest-neighbor-search search vector

qdrant/vector-db-benchmark

Framework for benchmarking vector search engines

Category
vector dbs and data
Stars
368
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

benchmark vector-database vector-search vector-search-engine

1yefuwang1/vectorlite

Fast, SQL powered, in-process vector search for any language with an SQLite driver

Category
vector dbs and data
Stars
362
Readiness
ready (79/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cpp17 hnsw python3 sqlite3 vector-database

dangkhoasdc/awesome-vector-database

A curated list of awesome works related to high dimensional structure/vector search & database

Category
vector dbs and data
Stars
358
Readiness
needs review (71/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +4 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

approximate-nearest-neighbor-search embedding-similarity embeddings-similarity nearest-neighbor-search search-engine similarity-search

zilliztech/attu

The Best GUI for Milvus

Category
vector dbs and data
Stars
3,084
Readiness
high risk (41/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +13 stars in 7 days

Why it may be a gem: limited evidence; inspect maintenance signals before adopting

Strongest signals: issue load. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

attu milvus vector-database

tensorchord/pgvecto.rs

Scalable, Low-latency and Hybrid-enabled Vector Search in Postgres. Revolutionize Vector Search, not Database.

Category
vector dbs and data
Stars
2,181
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 527 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

chatgpt faiss gpt hacktoberfest llm nearest-neighbor-search

featureform/featureform

The Virtual Feature Store. Turn your existing data infrastructure into a feature store.

Category
vector dbs and data
Stars
1,985
Readiness
high risk (42/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +3 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 400 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-quality data-science embeddings embeddings-similarity feature-engineering feature-store

neural-maze/ava-whatsapp-agent-course

Meet Ava, the WhatsApp Agent

Category
vector dbs and data
Stars
1,672
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
16/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 291 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent agent-based agentic-workflow agents stt tts

SkywalkerDarren/chatWeb

ChatWeb can crawl web pages, read PDF, DOCX, TXT, and extract the main content, then answer your questions based on the content, or summarize the key points.

Category
vector dbs and data
Stars
916
Readiness
needs review (57/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +3 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai chatgpt crawler docx embedding faiss

NeumTry/NeumAI

Neum AI is a best-in-class framework to manage the creation and synchronization of vector embeddings at large scale.

Category
vector dbs and data
Stars
867
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 935 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai chatgpt data data-engineering database embeddings

pgalko/BambooAI

A Python library powered by Language Models (LLMs) for conversational data discovery and analysis.

Category
vector dbs and data
Stars
784
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai ai-agents anthropic data-analysis data-science docker

stoyan-stoyanov/llmflows

LLMFlows - Simple, Explicit and Transparent LLM Apps

Category
vector dbs and data
Stars
707
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 533 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai chatgpt gpt-4 llm llm-inference llmops

jina-ai/vectordb

A Python vector database you just need - no more, no less.

Category
vector dbs and data
Stars
651
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 886 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

embedding-similarity neural-search sentence-embeddings vector-database vector-database-embedding vector-search

unbody-io/unbody

The Supabase of AI era. A modular, open-source backend for building AI-native software — designed for knowledge, not static data.

Category
vector dbs and data
Stars
525
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
19/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 115 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agentic-ai ai-native backend chatbot data-enhancement data-ingestion

different-ai/embedbase

A dead-simple API to build LLM-powered apps

Category
vector dbs and data
Stars
523
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 618 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai artificial-intelligence chatgpt chatgpt-plugin embeddings gpt-4

DonTizi/ReMind

Your Local Artificial Memory on your Device.

Category
vector dbs and data
Stars
518
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 589 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai artificial chromadb electronjs embeddings javascript

neurocult/agency

🕵️‍♂️ Library designed for developers eager to explore the potential of Large Language Models (LLMs) and other generative AI through a clean, effective, and Go-idiomatic approach.

Category
vector dbs and data
Stars
513
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 576 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agents ai artificial-general-intelligence artificial-intelligence artificial-neural-networks autonomous-agents

upstash/wikipedia-semantic-search

Semantic Search on Wikipedia with Upstash Vector

Category
vector dbs and data
Stars
470
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 238 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai search semantic vector vector-database

Jordan-Gilliam/ai-template

Mercury - Train your own custom GPT. Chat with any file, or website.

Category
vector dbs and data
Stars
452
Readiness
needs review (56/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 1065 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai chatgpt cheeriojs embeddings gpt-3 gpt-4

luyug/GradCache

Run Effective Large Batch Contrastive Learning Beyond GPU/TPU Memory Constraint

Category
vector dbs and data
Stars
444
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 864 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

contrastive-learning deep-learning embedding flax jax large-language-models

Haste171/langchain-chatbot

AI Chatbot for analyzing/extracting information from data in conversational format.

Category
vector dbs and data
Stars
439
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
70/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: repository is archived. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai artificial-intelligence bot chromadb discord discord-bot

m1guelpf/tinyvector

A tiny embedding database in pure Rust.

Category
vector dbs and data
Stars
436
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 953 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

embeddings embeddings-similarity machine-learning rust search-engines similarity-search

umbertogriffo/rag-chatbot

RAG (Retrieval-augmented generation) ChatBot that provides answers based on contextual information extracted from a collection of Markdown files.

Category
vector dbs and data
Stars
436
Readiness
needs review (65/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

chatbot chromadb gpu lamacpp llama3 llm

gannonh/memento-mcp

Memento MCP: A Knowledge Graph Memory System for LLMs

Category
vector dbs and data
Stars
425
Readiness
needs review (56/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 284 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

claude-desktop cursor knowledge-graph modelcontextprotocol neo4j vector-database

guangzhengli/vectorhub

Quickly and easily build AI website or application by using embeddings!

Category
vector dbs and data
Stars
386
Readiness
needs review (46/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 765 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

chatgpt chatpdf embedding embeddings gpt gpt-3

dusty-nv/NanoLLM

Optimized local inference for LLMs with HuggingFace-like APIs for quantization, vision/language models, multimodal agents, speech, vector DB, and RAG.

Category
vector dbs and data
Stars
382
Readiness
needs review (55/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 658 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

edge-ai llm-inference multimodal rag speech vector-database

EulerSearch/embedding_studio

Embedding Studio is a framework which allows you transform your Vector Database into a feature-rich Search Engine.

Category
vector dbs and data
Stars
382
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 470 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

embeddings embeddings-similarity fine-tuning llm-inference query-parser search-algorithm

datawhalechina/easy-vecdb

📚 从零开始的向量数据库原理与实践教程,在线阅读地址:https://easy-vecdb.datawhale.cc/

Category
vector dbs and data
Stars
379
Readiness
needs review (58/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-project annoy faiss hnsw ivfflat lsh

Aquila-Network/aquila

An easy to use Neural Search Engine. Index latent vectors along with JSON metadata and do efficient k-NN search.

Category
vector dbs and data
Stars
379
Readiness
high risk (40/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 823 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

approximate-nearest-neighbor-search aquila embedding faiss feature-vectors image-search

edwinkys/oasysdb

In-memory vector store with efficient read and write performance for semantic caching and retrieval system. Redis for Semantic Caching.

Category
vector dbs and data
Stars
376
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 616 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

approximate-nearest-neighbors ivfpq mysql open-source postgresql rust

MinishLab/vicinity

Lightweight Nearest Neighbors with Flexible Backends

Category
vector dbs and data
Stars
349
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +2 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai annoy embeddings faiss hnsw hnswlib

weaviate/weaviate-examples

Weaviate vector database – examples

Category
vector dbs and data
Stars
331
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 365 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

deep-learning examples vector-database vector-search vector-search-engine weaviate

braincrew-lab/langconnect-client

A Modern GUI Interface for Vector Database Management(Supports MCP integration)

Category
vector dbs and data
Stars
327
Readiness
needs review (58/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 394 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

langchain mcp postgresql vector-database

babycommando/entity-db

EntityDB is an in-browser vector database wrapping indexedDB and Transformers.js over WebAssembly

Category
vector dbs and data
Stars
296
Readiness
high risk (41/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 456 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

db dbbrowser embeddings idb indexed-db indexeddb

flanker/chromadb-admin

Admin UI for Chroma embedding database built with Next.js

Category
vector dbs and data
Stars
282
Readiness
needs review (61/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 264 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

chroma chromadb embeddings openai vector-database

RelevanceAI/relevanceai

Home of the AI workforce - Multi-agent system, AI agents & tools

Category
vector dbs and data
Stars
282
Readiness
needs review (57/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 204 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

clustering computer-vision embeddings natural-language-processing nlp python

wangxb96/RAG-QA-Generator

RAG-QA-Generator 是一个用于检索增强生成(RAG)系统的自动化知识库构建与管理工具。该工具通过读取文档数据,利用大规模语言模型生成高质量的问答对(QA对),并将这些数据插入数据库中,实现RAG系统知识库的自动化构建和管理。

Category
vector dbs and data
Stars
278
Readiness
needs review (55/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 589 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

large-language-models question-answering retrieval-augmented-generation unstructured-data vector-database

TimeSurgeLabs/athenadb

🦉⚡️Serverless, distributed vector database as an API

Category
vector dbs and data
Stars
272
Readiness
high risk (42/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 900 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cloudflare cloudflare-ai cloudflare-d1 cloudflare-vectorize cloudflare-workers cloudflare-workers-ai

0xnyn/tinkerbird

Client Side Vector Database

Category
vector dbs and data
Stars
271
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 313 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

chrome hnsw indexeddb typescript vector-database

not-pizza/victor

Web-optimized vector database (written in Rust).

Category
vector dbs and data
Stars
262
Readiness
high risk (41/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 30 days

Why it may be a gem: limited evidence; inspect maintenance signals before adopting

Strongest signals: issue load, documentation. Risks: no push in 527 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

embeddings indexeddb pca vector-database wasm

oramasearch/oramacore

OramaCore is the complete runtime you need for your projects, answer engines, copilots, and search. It includes a fully-fledged full-text search engine, vector database, LLM interface, and many more u

Category
vector dbs and data
Stars
258
Readiness
high risk (44/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
19/100 · low confidence

Why: +5 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 115 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

fulltext-search inference llms vector-database vector-search

nitaiaharoni1/vector-storage

Vector Storage is a vector database that enables semantic similarity searches on text documents in the browser's local storage. It uses OpenAI embeddings to convert documents into vectors and allows s

Category
vector dbs and data
Stars
246
Readiness
needs review (57/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 604 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cosine-similarity embedding-vectors javascript local-storage localstorage lru-cache

antarys-ai/python

Python client for Antarys vector database, optimized for large-scale vector operations with built-in caching, parallel processing, and dimension validation.

Category
vector dbs and data
Stars
233
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 305 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

llm machine-learning rag search vector-database vector-search

coder/hnsw

In-memory vector index for Go

Category
vector dbs and data
Stars
233
Readiness
needs review (56/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai faiss go golang vector-database

DerwenAI/strwythura

Strwythura: construct an entity-resolved knowledge graph from structured data sources and unstructured content sources, implementing an ontology pipeline, plus context engineering for optimizing AI ap

Category
vector dbs and data
Stars
231
Readiness
needs review (55/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
19/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 114 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

dspy entity-embedding entity-linking entity-resolution entity-resolved-knowledge-graph epistemic-literacy

IngestAI/embedditor

⚡ GUI for editing LLM vector embeddings. No more blind chunking. Upload content in any file extension, join and split chunks, edit metadata and embedding tokens + remove stop-words and punctuation wi

Category
vector dbs and data
Stars
227
Readiness
high risk (43/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 990 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

datapreprocessing datascience embedding-vectors embeddings genai laravel

Dripfarm/SVDB

Swift Vector Database. On-device, local vector database for building the next-generation of user experiences

Category
vector dbs and data
Stars
223
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, documentation, license. Risks: no push in 243 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

embeddings llm swift vector-database vector-db

biocypher/biochatter

Backend library for conversational AI in biomedicine

Category
vector dbs and data
Stars
216
Readiness
ready (86/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

biocypher chatbot knowledge-graph llm retrieval-augmented-generation vector-database

gusye1234/nano-vectordb

A simple, easy-to-hack Vector Database

Category
vector dbs and data
Stars
206
Readiness
needs review (49/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, documentation, license. Risks: no push in 210 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

embedding rag vector vector-database

monkesearch/monkeSearch

fully local, temporally aware natural language file search on your pc! even without a GPU. find relevant files using natural language in less than 1 second.

Category
vector dbs and data
Stars
203
Readiness
needs review (59/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +3 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

leann llm-inference monkesearch natural-language-processing nlp semantic-search

upstash/upsy

Your new mate on Discord and Slack. Powered by AI.

Category
vector dbs and data
Stars
200
Readiness
high risk (39/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 686 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai chatbots rag vector-database

nucleuscloud/neosync

Open Source Data Security Platform for Developers to Monitor and Detect PII, Anonymize Production Data and Sync it across environments.

Category
vector dbs and data
Stars
4,146
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
100/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: repository is archived, no push in 342 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

benthos docker etl faker fine-tuning golang

instill-ai/instill-core

🔮 Instill Core is a full-stack AI infrastructure tool for data, model and pipeline orchestration, designed to streamline every aspect of building versatile AI-first applications

Category
vector dbs and data
Stars
2,319
Readiness
high risk (43/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai api cli developer-tools etl generative-ai

ariacom/Seal-Report

Database Reporting Tool and Tasks (.Net)

Category
vector dbs and data
Stars
1,625
Readiness
ready (93/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-agents ai-tools business-intelligence chart dashboards etl

Eventual-Inc/Daft

High-performance data engine for AI and multimodal workloads. Process images, audio, video, and structured data at any scale

Category
vector dbs and data
Stars
5,693
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +17 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-engineering ai-pipeline arrow artificial-intelligence big-data data-engineering

qdrant/skills

Agent skills for Qdrant vector search: scaling, performance optimization, search quality, monitoring, deployment, model migration, version upgrades, and SDK usage across Python, TypeScript, Rust, Go,

Category
vector dbs and data
Stars
220
Readiness
ready (92/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +7 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent-skills ai-agents claude-code codex cursor embeddings

amikos-tech/chroma-go

The Go client for Chroma vector database

Category
vector dbs and data
Stars
207
Readiness
ready (88/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

chromadb client embeddings vector-database

dgarnitz/vectorflow

VectorFlow is a high volume vector embedding pipeline that ingests raw data, transforms it into vectors and writes it to a vector DB of your choice.

Category
vector dbs and data
Stars
703
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 813 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai data-engineering embeddings machine-learning nlp vectors

apache/airflow

Apache Airflow - A platform to programmatically author, schedule, and monitor workflows

Category
vector dbs and data
Stars
46,409
Readiness
ready (98/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +63 stars in 7 days; 100+ commits in 30 days

Why it may be a gem: consistent human and community activity; healthy maintenance and project fundamentals

Strongest signals: push recency, commit activity, contributor breadth. Risks: None identified. Missing inputs: None.

Capped lower bounds: 30-day commits, lifetime contributors, response activity.

airflow apache apache-airflow automation dag data-engineering

Avaiga/taipy

Turns Data and AI algorithms into production-ready web applications in no time.

Category
vector dbs and data
Stars
19,397
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +59 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

automation data-engineering data-integration data-ops data-visualization datascience

argoproj/argo-workflows

Workflow Engine for Kubernetes

Category
vector dbs and data
Stars
16,884
Readiness
ready (97/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +23 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow argo argo-workflows batch-processing cloud-native cncf

dagster-io/dagster

An orchestration platform for the development, production, and observation of data assets.

Category
vector dbs and data
Stars
15,944
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +24 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics dagster data-engineering data-integration data-orchestrator data-pipelines

fivetran/great_expectations

Always know what to expect from your data.

Category
vector dbs and data
Stars
11,699
Readiness
ready (95/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +10 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cleandata data-engineering data-profilers data-profiling data-quality data-science

feast-dev/feast

The Open Source Feature Store for AI/ML

Category
vector dbs and data
Stars
7,198
Readiness
ready (95/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +14 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data data-engineering data-quality data-science feature-store features

Netflix/maestro

Maestro: Netflix’s Workflow Orchestrator

Category
vector dbs and data
Stars
3,811
Readiness
ready (86/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +13 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agentic-workflow analytics automation batch-processing dag data-engineering

apache/hamilton

Apache Hamilton helps data scientists and engineers define testable, modular, self-documenting dataflows, that encode lineage/tracing and metadata. Runs and scales everywhere python does.

Category
vector dbs and data
Stars
2,558
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

dag data-analysis data-engineering data-science dataframe etl

4paradigm/OpenMLDB

OpenMLDB is an open-source machine learning database that provides a feature platform computing consistent features for training and inference.

Category
vector dbs and data
Stars
1,701
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

database-for-ai database-for-machine-learning feature-engineering feature-extraction feature-store featureops

fmind/mlops-python-package

A comprehensive Python package template to kickstart and standardize your MLOps initiatives and data pipelines.

Category
vector dbs and data
Stars
1,417
Readiness
ready (79/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

automation data-engineering data-pipelines data-science machine-learning machine-learning-operations

GokuMohandas/Made-With-ML

Learn how to develop, deploy and iterate on production-grade ML applications.

Category
vector dbs and data
Stars
49,008
Readiness
high risk (35/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
risky
Maintenance risk
60/100 · high confidence

Why: +70 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; open issue backlog is stable or shrinking

Strongest signals: issue load, documentation, license. Risks: no push in 156 days, 27 open issues with no maintainer issue responses in 30 days, no pull-request review responses in 30 days, no maintainer response activity in 30 days. Missing inputs: None.

data-engineering data-quality data-science deep-learning distributed-ml distributed-training

hemansnation/AI-Engineer-Headquarters

A collection of scientific methods, processes, algorithms, and systems to build stories & models.

Category
vector dbs and data
Stars
3,672
Readiness
needs review (47/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 273 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

computer-vision data-engineering data-science data-structures-and-algorithms data-system-design data-visualization

ploomber/ploomber

The fastest ⚡️ way to build data pipelines. Develop iteratively, deploy anywhere. ☁️

Category
vector dbs and data
Stars
3,622
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
94/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: repository is archived, no push in 435 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-science jupyter jupyter-notebooks machine-learning mlops

GokuMohandas/mlops-course

Learn how to design, develop, deploy and iterate on production-grade ML applications.

Category
vector dbs and data
Stars
3,390
Readiness
needs review (58/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 721 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-quality data-science deep-learning distributed-ml llms

whylabs/whylogs

An open-source data logging library for machine learning models and data pipelines. 📚 Provides visibility into data quality & model performance over time. 🛡️ Supports privacy-preserving data collectio

Category
vector dbs and data
Stars
2,829
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +4 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 574 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-pipelines analytics approximate-statistics calculate-statistics constraints data-constraints

feathr-ai/feathr

Feathr – A scalable, unified data and AI engineering platform for enterprise

Category
vector dbs and data
Stars
1,939
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +5 stars in 30 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 855 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-spark artificial-intelligence azure data-engineering data-quality data-science

abhishek-ch/around-dataengineering

A Data Engineering & Machine Learning Knowledge Hub

Category
vector dbs and data
Stars
1,142
Readiness
needs review (47/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 917 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow data-engineering datascience devops infrastructure machine-learning

sematic-ai/sematic

An open-source ML pipeline development platform

Category
vector dbs and data
Stars
999
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 575 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai data-science machine-learning ml ml-ops ml-pipeline

onepanelio/onepanel

The open source, end-to-end computer vision platform. Label, build, train, tune, deploy and automate in a unified platform that runs on any cloud and on-premises.

Category
vector dbs and data
Stars
731
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 1259 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai aiops annotation computer-vision deeplearning etl

decodingai-magazine/personalized-recommender-course

👕 Open-source course on architecting, building and deploying a real-time personalized recommender for H&M fashion articles.

Category
vector dbs and data
Stars
649
Readiness
needs review (60/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

course feature-store mlops personalized-recommendation python recommender-system

pracdata/awesome-open-source-data-engineering

A curated list of open source tools used in analytics platforms and data engineering ecosystem

Category
vector dbs and data
Stars
596
Readiness
high risk (44/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
21/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 513 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics awesome awesome-list data data-analytics data-engineering

george0st/qgate-model

ML/AI meta-model, used in MLRun/Iguazio/Nuclio, see qgate-sln-<MLRun | solution>

Category
vector dbs and data
Stars
410
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 355 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-science feature-store iguazu machine-learning meta-model mlops

qdrant/qdrant-edge-demo

POC visual search with smart glasses and Qdrant Edge.

Category
vector dbs and data
Stars
60
Readiness
ready (74/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-memory ai-memory-system edge edge-ai embedded-ai vector-database

NTU-Siqiang-Group/AsterVec

Embedded on-device vector database for AI agent memory and local RAG — disk-based HNSW in an LSM-tree, C++/Python, optimized for low memory footprint

Category
vector dbs and data
Stars
32
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-memory approximate-nearest-neighbor-search cpp embedded-database hnsw lsm-tree

NVIDIA/raft

RAFT contains fundamental widely-used algorithms and primitives for machine learning and information retrieval. The algorithms are CUDA-accelerated and form building blocks for more easily writing hig

Category
vector dbs and data
Stars
1,036
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

anns building-blocks clustering cuda distance gpu

NVIDIA/cuvs

cuVS - a library for vector search and clustering on the GPU

Category
vector dbs and data
Stars
830
Readiness
ready (85/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

anns clustering cuda distance gpu information-retrieval

thustorage/PipeANN

A low-latency, billion-scale, and updatable graph-based vector store on SSD.

Category
vector dbs and data
Stars
145
Readiness
ready (88/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

anns approximate-nearest-neighbor-search billion-scale diskann fast odinann

scylladb/vector-search-examples

Vector search examples with ScyllaDB

Category
vector dbs and data
Stars
9
Readiness
ready (77/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

nosql scylladb semantic-seach vector vector-database vector-search

NVIDIA/cuvs-lucene

A Lucene codec for vector search and clustering on the GPU

Category
vector dbs and data
Stars
9
Readiness
ready (81/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

anns cuda gpu hybrid-search information-retrieval lucene

openpeeps/boogie

A suite of WAL-based embedded data stores. RDBMS, KV Store, GraphStore, VectorStore, Columnar and more

Category
vector dbs and data
Stars
6
Readiness
ready (75/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cache-storage columnar-storage database databases db-system embedded-database

airbytehq/airbyte

Open-source data movement for ELT pipelines and AI agents — from APIs, databases & files to warehouses, lakes, and AI applications. Both self-hosted and Cloud.

Category
vector dbs and data
Stars
21,841
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +86 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery change-data-capture data data-analysis data-collection data-engineering

apache/shardingsphere

Empowering Data Intelligence with Distributed SQL for Sharding, Scalability, and Security Across All Databases.

Category
vector dbs and data
Stars
20,773
Readiness
ready (100/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigdata data-encryption data-pipeline database database-cluster database-gateway

debezium/debezium

Change data capture for a variety of databases. Please log issues at https://github.com/debezium/dbz/issues.

Category
vector dbs and data
Stars
12,989
Readiness
ready (99/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +20 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-kafka cdc change-data-capture data-pipeline database debezium

datajuicer/data-juicer

Data processing for and with foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

Category
vector dbs and data
Stars
6,845
Readiness
ready (90/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +31 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-analysis data-pipeline data-processing data-science data-visualization

apache/flink-cdc

Flink CDC is a streaming data integration tool

Category
vector dbs and data
Stars
6,455
Readiness
ready (100/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

batch cdc change-data-capture data-integration data-pipeline distributed

rudderlabs/rudder-server

Privacy and Security focused Segment-alternative, in Golang and React

Category
vector dbs and data
Stars
4,465
Readiness
ready (79/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery cdp customer-data customer-data-lake customer-data-pipeline customer-data-platform

bruin-data/ingestr

ingestr is a CLI tool to copy data between any databases with a single command seamlessly.

Category
vector dbs and data
Stars
3,832
Readiness
ready (80/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery copy-database data-ingestion data-integration data-pipeline duckdb

elementary-data/elementary

The dbt-native data observability solution for data & analytics engineers. Monitor your data pipelines in minutes. Available as self-hosted or cloud service with premium features.

Category
vector dbs and data
Stars
2,387
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics-engineer bigquery data-analysis data-governance data-lineage data-observability

Multiwoven/multiwoven

🔥🔥🔥 Open source Reverse ETL - alternative to hightouch and census.

Category
vector dbs and data
Stars
1,666
Readiness
ready (79/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery cdp customer-data-platform data-activation data-engineering data-pipeline

datazip-inc/olake

OLake - Fastest Databases, Kafka & S3 Replication to Apache Iceberg with Table optimization (Called OLake Fusion). ⚡ Efficient, quick and scalable data ingestion for real-time analytics. Supported so

Category
vector dbs and data
Stars
1,418
Readiness
ready (94/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-iceberg cdc change-data-capture data-pipeline database elt

slothflowlabs/duckle

Open-source ETL and ELT tool on DuckDB. Low-code visual data pipelines or SQL: 364 components, dbt, CDC, data quality, reverse ETL, lineage, MCP for AI agents.

Category
vector dbs and data
Stars
1,019
Readiness
ready (90/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +124 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cdc connectors data-engineering data-integration data-orchestration data-pipeline

authorjapps/zerocode

zerocode-tdd is a community-developed, free, open-source, outcome-driven automated testing for Data Pipelines, ETL, REST API, Kafka(Data Streams), Databases and Load scenarios. all defined in simple J

Category
vector dbs and data
Stars
1,010
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

api assertions automation automation-framework data-pipeline dsl

estuary/flow

🌊 Continuously synchronize the systems where your data lives, to the systems where you _want_ it to live, by managing your data flows with Estuary. 🌊

Category
vector dbs and data
Stars
960
Readiness
ready (79/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

change-data-capture data data-collection data-engineering data-integration data-pipeline

AgnostiqHQ/covalent

Pythonic tool for orchestrating machine-learning/high performance/quantum-computing workflows in heterogeneous compute environments.

Category
vector dbs and data
Stars
867
Readiness
ready (76/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

covalent data-pipeline data-science deep-learning hacktoberfest hpc

ConduitIO/conduit

Conduit streams data between data stores. Kafka Connect replacement. No JVM required.

Category
vector dbs and data
Stars
603
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

conduit data-engineering data-integration data-pipeline data-stream etl

ModelEngine-Group/DataMate

DataMate is an enterprise-level data processing platform designed for model fine-tuning and RAG retrieval.

Category
vector dbs and data
Stars
365
Readiness
ready (86/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-evaluation data-pipeline data-synthesis rag

rocky-data/rocky

A SQL transformation engine that type-checks your whole pipeline and catches breaking changes before they run — branches, replay, column-level lineage, compile-time contracts, per-model cost. Adapters

Category
vector dbs and data
Stars
292
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery column-lineage dagster data-contracts data-engineering data-lineage

pipeline-tools/gusty

Making DAG construction easier

Category
vector dbs and data
Stars
286
Readiness
ready (84/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow data-etl data-pipeline

ohs-foundation/fhir-data-pipes

A collection of tools for extracting FHIR resources and analytics services on top of that data.

Category
vector dbs and data
Stars
222
Readiness
ready (87/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics apache-beam data-pipeline digital-health etl fhir-store

DataSQRL/sqrl

Agentic Data Engineering Harness for building data pipelines, data products, data APIs, and data lakes autonomously

Category
vector dbs and data
Stars
220
Readiness
ready (86/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

api data-engineering data-pipeline event-driven harness harness-framework

starlake-ai/starlake

Declarative text based tool for data analysts and engineers to extract, load, transform and orchestrate their data pipelines.

Category
vector dbs and data
Stars
209
Readiness
ready (85/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery data-engineering data-integration data-pipeline etl hdfs

olirice/flupy

Fluent data pipelines for python and your shell

Category
vector dbs and data
Stars
195
Readiness
ready (72/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

collections data-pipeline fluent python

Feashliaa/job-board-aggregator

Job board aggregator indexing 1,000,000+ active positions from 20,000+ companies across Greenhouse, Lever, Ashby, Workday, and other major ATS platforms. Multithreaded Python ETL pipeline, daily autom

Category
vector dbs and data
Stars
105
Readiness
ready (99/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ats data-engineering data-pipeline etl github-actions gzip

ultralytics/stars

Daily Ultralytics analytics for GitHub, PyPI, Google Analytics, Reddit, and Platform metrics, published as static JSON with historical star tracking.

Category
vector dbs and data
Stars
88
Readiness
ready (81/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

automation data-pipeline github-analytics github-stars google-analytics json

opensnowcat/opensnowcat-collector

OpenSnowcat Collector, an open source fork of Snowplow (Apache 2.0 License)

Category
vector dbs and data
Stars
76
Readiness
ready (87/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics data-engineering data-pipeline event-pipeline snowplow

mloda-ai/mloda

mloda.ai - Open Data Access for AI and ML. Plugin-based. Traceable. Framework-agnostic.

Category
vector dbs and data
Stars
73
Readiness
ready (94/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-agents community-driven context-engineering data-access data-engineering data-pipeline

minhadona/data_engineer_interview_challenges

Found a data engineering challenge or participated in a selection process ? Share with us!

Category
vector dbs and data
Stars
70
Readiness
ready (76/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

beginner beginner-friendly beginner-project beginners code-challenge-practice code-challenges

maltzsama/dagster-authkit

Community Auth System for self-hosted Dagster OSS - simple RBAC, Audit-log, and Session Management

Category
vector dbs and data
Stars
62
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

authelia authentication authentication-middleware dagster dagster-auth dagster-project

scribe-org/Scribe-Data

Wikidata and Wiktionary language data extraction

Category
vector dbs and data
Stars
61
Readiness
ready (86/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cli data data-pipeline database dictionary education

renart-data/renart

The IDE for git-native data pipelines

Category
vector dbs and data
Stars
60
Readiness
ready (84/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +18 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-pipeline developer-tools elt etl ide

ultralytics/yoloe_data_engine

YOLOE data pipeline for grounding and detection labels, predictions, text refinement, cache generation, and visualization.

Category
vector dbs and data
Stars
60
Readiness
ready (77/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

computer-vision data-pipeline dataset-annotation dataset-generation grounding label-refinement

caiopizzol/fipe-data-pipeline

Coleta e processa dados históricos de preços da Tabela FIPE para PostgreSQL.

Category
vector dbs and data
Stars
49
Readiness
ready (79/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bun data-pipeline fipe fipe-api postgresql tabela-fipe

apitap/apitap-lib

Move whole tables between databases fast — Postgres, MySQL, ClickHouse, BigQuery. Rust engine, one-line Python API, bounded memory.

Category
vector dbs and data
Stars
48
Readiness
ready (92/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +21 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

benchmark bigquery clickhouse data-engineering data-ingestions data-pipeline

GoPlasmatic/dataflow-rs

A high-performance rules engine for IFTTT-style automation in Rust with zero-overhead JSONLogic evaluation

Category
vector dbs and data
Stars
45
Readiness
ready (86/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-pipeline event-driven rust workflow-engine

zazuko/barnard59

An intuitive and flexible RDF pipeline solution designed to simplify and automate ETL processes for efficient data management.

Category
vector dbs and data
Stars
40
Readiness
needs review (61/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility

Strongest signals: push recency, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-integration data-pipeline data-processing etl json-ld linked-data

neochaotic/leoflow

GitOps-first, container-native workflow orchestrator in Go (Airflow-UI compatible).

Category
vector dbs and data
Stars
40
Readiness
needs review (70/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow apache-airflow container-native dag data-engineering data-pipeline

PFund-Software-Ltd/pfeed

Data Engine for AI/Algo Trading: Download/Stream -> Clean -> Store. Supports Data Lakehouse Architecture. Clean Once and Forget.

Category
vector dbs and data
Stars
34
Readiness
ready (98/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

algo-trading backtesting data-lakehouse data-pipeline data-storage delta-lake

ozkary/data-engineering-mta-turnstile

Data Engineering - Metropolitan Transportation Authority (MTA) Subway Data Analysis

Category
vector dbs and data
Stars
34
Readiness
ready (85/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analysis bigquery data-engineering data-lake data-modeling data-orchestration

opensnowcat/opensnowcat-enrich

OpenSnowcat Enricher (Apache 2.0 License)

Category
vector dbs and data
Stars
33
Readiness
ready (98/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-data-collection analytics apache-2-0-license behavioral-data data-collection data-engineering

GramosoftAI/GcrawlAI

Turn any website into clean, LLM-ready data. Open-source web crawler with stealth mode, distributed crawling, real-time WebSocket progress & Markdown output. Power your AI apps with GcrawlAI.

Category
vector dbs and data
Stars
32
Readiness
ready (93/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +8 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai celery data-pipeline document-extraction fastapi llm

guidok91/spark-movies-etl

Spark data pipeline that processes movie ratings data.

Category
vector dbs and data
Stars
31
Readiness
ready (83/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-iceberg data-engineering data-pipeline elt etl pyspark

AbsaOSS/pramen

Resilient data pipeline framework running on Apache Spark

Category
vector dbs and data
Stars
31
Readiness
ready (75/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data data-pipeline etl hacktoberfest scala spark

Bruno-Furtado/cloud-cnpj

Ingestão, preparação e disponibilização gratuita de dados de CNPJs de empresas do Brasil no Google Cloud.

Category
vector dbs and data
Stars
30
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery-public-datasets cloud-storage data-pipeline empresas-brasileiras etl google-cloud-platform

drt-hub/drt

Reverse ETL for the code-first data stack

Category
vector dbs and data
Stars
29
Readiness
ready (81/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery cli clickhouse dagster data-activation data-engineering

GregoryKogan/yt-framework

Build scalable data pipelines on YTsaurus with automatic stage management, local development simulation, and more.

Category
vector dbs and data
Stars
28
Readiness
ready (77/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data data-pipeline distributed-computing etl framework map-reduce

Victor-Kipruto-Rop/Real_Time_Transaction_Streaming-MPESA-

Real-Time M-Pesa Transaction Streaming Pipeline built using modern data engineering technologies to ingest, process, stream, and analyze transaction data in real time. Demonstrates event-driven archit

Category
vector dbs and data
Stars
27
Readiness
needs review (56/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache apache-kafka apache-spark data-engineering data-pipeline data-pipeline-monitoring

Mohith-akash/Global-News-Intel-Platform

AI-powered geopolitical news intelligence platform. Ingests 100K+ daily events from GDELT, stores in MotherDuck (DuckDB), orchestrates with Dagster, and features an AI chat interface with Text-to-SQL.

Category
vector dbs and data
Stars
22
Readiness
ready (90/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai cerebras ci-cd dagster dashboard data-analytics

YangSal/ashares_data_collect

自动化 A 股金融数据采集平台:行情/财务/Tick,DAG 编排 + 定时调度 + 查漏补缺。 Automated A-share market-data platform: K-line, financials & tick via QMT/xtquant — DAG pipelines, scheduling, gap-filling, PostgreSQL + Parquet

Category
vector dbs and data
Stars
22
Readiness
ready (85/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

a-shares china-stock-market data-pipeline financial-data market-data miniqmt

slotix/dbconvert-streams-public

DBConvert Streams: Database IDE, Federated SQL, Real-time CDC & AI assistants via MCP — explore, query, and replicate data across databases and files

Category
vector dbs and data
Stars
22
Readiness
ready (82/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cdc change-data-capture data-engineering data-integration data-migration data-pipeline

subsquid/pipes-sdk

TypeScript SDK for streaming blockchain data: tap SQD Portal sources, decode EVM/Solana/Bitcoin/Tron/Hyperliquid onchain data, handle reorgs, write to Postgres, ClickHouse, BigQuery, or Parquet.

Category
vector dbs and data
Stars
19
Readiness
ready (80/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery bitcoin blockchain blockchain-indexer clickhouse data-pipeline

2233admin/opencli-Razormind

做研究的人都有这种时刻:资料堆了一桌,结论还在雾里。opencli-admin 是一条自托管的研究与情报流水线——可视化编排工作流,采集、AI 处理、证据关联依次就位,数据全程留在自己手里。它做的不是信息的搬运,而是让散落的证据彼此相认。

Category
vector dbs and data
Stars
14
Readiness
needs review (67/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility

Strongest signals: push recency, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-agents ai-processing browser-automation data-collection data-pipeline docker

Liam0205/pineapple

Multi-runtime DAG pipeline engine — declare in Python, execute in Go / Java / Python, decouple with JSON.

Category
vector dbs and data
Stars
13
Readiness
ready (82/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

dag data-pipeline dsl go hot-reload java

TanMusong/fav-vault

An automation pipeline that converts social media bookmarks into download tasks, automatically fetches content, and organizes it into a structured local archive.

Category
vector dbs and data
Stars
13
Readiness
ready (76/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

automation bookmark-manager content-archiver crawler data-pipeline douyin-downloader

simonplmak-cloud/hkex-filing-scraper

Scrape and ingest HKEx (Hong Kong Stock Exchange) regulatory filings into SurrealDB with full-text extraction and graph linking.

Category
vector dbs and data
Stars
12
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-pipeline etl financial-data graph-database hkex hong-kong

godstime-dev/crypto-data-pipeline

Real-time crypto data pipeline built with Python, featuring automated ETL workflows, API ingestion, Duckdb storage, market trend analysis, and Discord alerting.

Category
vector dbs and data
Stars
12
Readiness
needs review (63/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apis apscheduler automation backend crypto data-engineering

chalk-ai/chalk-go

Go client for Chalk

Category
vector dbs and data
Stars
11
Readiness
ready (77/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: strong signals despite limited visibility

Strongest signals: push recency, fork interest, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-pipeline feature-engineering

ankiano/etl

Extract transform load CLI tool for extracting small and middle data volume from sources (databases, csv files, xls files, gspreadsheets) to target (databases, csv files, xls files, gspreadsheets) in

Category
vector dbs and data
Stars
11
Readiness
ready (85/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

business-intelligence data-engineering data-lake data-pipeline database datapipeline

scribe-org/Scribe-Server

Backend service for Scribe data downloads

Category
vector dbs and data
Stars
11
Readiness
ready (84/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

api backend data data-downloader data-pipeline dictionary

EmpaEconversion/aurora-cycler-manager

Battery cycler management, data analysis and visualisation.

Category
vector dbs and data
Stars
8
Readiness
ready (81/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

batteries dashboard data-pipeline instrument-control

tarique-iqbal/nyc-taxi

Production-grade streaming ETL pipeline for NYC Yellow Taxi data using Kafka, DDD-based validation and enrichment, ClickHouse for sub-second analytics, and real-time Grafana dashboards.

Category
vector dbs and data
Stars
8
Readiness
ready (85/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

clickhouse data-pipeline docker domain-driven-design fastapi grafana

tracebloc/data-ingestors

tracebloc data pipeline for training/test dataset setup

Category
vector dbs and data
Stars
8
Readiness
needs review (70/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-ingestion data-pipeline data-preparation data-preprocessing-and-cleaning data-validation tracebloc

Indexical-Metrics-Measure-Advisory/watchmen

Watchmen Platform is a low code data platform for data pipeline, meta data management , analysis, indicator objective analysis and quality management

Category
vector dbs and data
Stars
8
Readiness
ready (100/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

charts data-pipeline data-quality data-quality-monitoring data-visualization indicator

DevDizzle/gammarips-engine

End-to-end AI market intelligence platform for high-gamma options trading. Powers the GammaRips application with automated data pipelines on GCP.

Category
vector dbs and data
Stars
8
Readiness
ready (93/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai big-query cloud-functions data-pipeline financial-data google-cloud

cristianm-developer/ETLCoreStream-React

React-first headless ETL framework for building reactive, composable, and scalable data import/export interfaces on top of ETL CoreStream.

Category
vector dbs and data
Stars
7
Readiness
ready (74/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

compound-components csv-import data-pipeline data-validation etl headless-ui

estuary/agent-skills

Agent skills for setting up and operating Estuary data pipelines through your AI assistant.

Category
vector dbs and data
Stars
7
Readiness
ready (72/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent-skills ai-agents cdc change-data-capture claude-code codex

faucet-hq/faucet-stream

The fast, config-driven way to move data in Rust — a native CLI and an embeddable Rust ETL library

Category
vector dbs and data
Stars
7
Readiness
ready (73/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cdc cli connectors data-engineering data-integration data-pipeline

omkhalane/eventio

All tech events. One calendar. Eventio aggregates coding contests, hackathons, and hiring challenges from 70+ platforms into a unified, real-time calendar powered by automated scraping pipelines.

Category
vector dbs and data
Stars
7
Readiness
needs review (67/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

automation calendar coding-contests data-pipeline developer-tools event-aggregation

chnm/bom

Website files, database GUI, and data pipeline scripts for the London Bills of Mortality digital history project.

Category
vector dbs and data
Stars
7
Readiness
needs review (64/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-pipeline hugo monorepo python

bladepipe/bladepipe-official-site-and-docs

Official website and documentation source for BladePipe, a real-time CDC and data integration platform for replication, migration, analytics, and AI pipelines.

Category
vector dbs and data
Stars
7
Readiness
ready (75/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cdc change-data-capture data-integration data-migration data-pipeline data-replication

BlacKSnowDot0/Proxy-Pulse

Automated discovery, validation, and publishing of public HTTP/SOCKS proxy lists sourced from GitHub repositories and gists

Category
vector dbs and data
Stars
7
Readiness
ready (82/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

automation data-pipeline gists github-api go http-proxy

GoPlasmatic/Orion

An API-first declarative services runtime in Rust. Build and scale governed REST & Kafka endpoints with JSON workflows, built-in observability, and AI safety rails.

Category
vector dbs and data
Stars
7
Readiness
ready (80/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

business-logic business-rules data-pipeline event-processing jsonlogic rules-engine

0xArchiveIO/sdk-python

Python client for 0xArchive: granular market data for Hyperliquid (perps, HIP-3, HIP-4, Spot) and Lighter.xyz.

Category
vector dbs and data
Stars
7
Readiness
ready (86/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-pipeline hyperliquid lighterxyz market-data python rest-api

illuin-tech/data-pipeline

Library for describing data transformation pipelines by compositing simple reusable components.

Category
vector dbs and data
Stars
6
Readiness
needs review (67/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-pipeline etl java

Seddryck/Streamistry

Streamistry is a lightweight library designed to support pipeline, streaming, and ETL development for data engineering and integration. Its versatility makes it an excellent tool for building robust,

Category
vector dbs and data
Stars
6
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

computational-pipeline data-engineering data-integration data-pipeline etl streaming-data

snowplow/snowplow

The leader in Customer Data Infrastructure

Category
vector dbs and data
Stars
7,028
Readiness
needs review (69/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics data data-collection data-pipeline marketing-analytics product-analytics

adilkhash/Data-Engineering-HowTo

A list of useful resources to learn Data Engineering from scratch

Category
vector dbs and data
Stars
4,007
Readiness
high risk (44/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 779 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cloud-providers data-engineering data-pipeline distributed-systems scala

superstreamlabs/memphis

Memphis.dev is a highly scalable and effortless data streaming platform

Category
vector dbs and data
Stars
3,432
Readiness
high risk (43/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
26/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 158 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-engineering data-pipeline data-stream-processing data-streaming enrichment

reugn/go-streams

A lightweight stream processing library for Go

Category
vector dbs and data
Stars
2,172
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 205 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

aerospike data-pipeline data-stream etl kafka kafka-streams

pydoit/doit

CLI task management & automation tool

Category
vector dbs and data
Stars
2,077
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
29/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 176 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

build-automation build-system build-tool cli data-pipeline data-science

bytedance/bitsail

BitSail is a distributed high-performance data integration engine which supports batch, streaming and incremental scenarios. BitSail is widely used to synchronize hundreds of trillions of data every d

Category
vector dbs and data
Stars
1,676
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
100/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: repository is archived, no push in 949 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data data-integration data-lake data-pipeline data-synchronization flink

GoogleCloudPlatform/data-science-on-gcp

Source code accompanying book: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017

Category
vector dbs and data
Stars
1,429
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cloud-computing data-analysis data-engineering data-pipeline data-processing data-science

damklis/DataEngineeringProject

Example end to end data engineering project.

Category
vector dbs and data
Stars
1,423
Readiness
needs review (59/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1338 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow big-data data-engineering data-pipeline debezium django-rest-framework

spotify/klio

Smarter data pipelines for audio.

Category
vector dbs and data
Stars
874
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 940 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

audio-processing data-pipeline media-processing signal-processing

apache/seatunnel-web

SeaTunnel is a distributed, high-performance data integration platform for the synchronization and transformation of massive data (offline & real-time).

Category
vector dbs and data
Stars
868
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 197 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache data-integration data-pipeline etl-framework high-performance offline

ssp-data/practical-data-engineering

Practical Data Engineering: A Hands-On Real-Estate Project Guide

Category
vector dbs and data
Stars
816
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

dagster data-engineering data-pipeline

infoslack/awesome-kafka

A list about Apache Kafka

Category
vector dbs and data
Stars
591
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: limited evidence; inspect maintenance signals before adopting

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-kafka apache-spark data-pipeline data-processing infrastructure kafka

sparkfish/augraphy

Augmentation pipeline for rendering synthetic paper printing, faxing, scanning and copy machine processes

Category
vector dbs and data
Stars
563
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 383 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

augmentation-pipeline computer-vision crappification data-augmentation data-pipeline deep-neural-networks

InfuseAI/piperider

Code review for data in dbt

Category
vector dbs and data
Stars
495
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 581 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

code-review continuous-integration data-exploration data-observability data-pipeline data-profiler

dataflint/spark

Drop-in replacement for Apache Spark UI

Category
vector dbs and data
Stars
482
Readiness
needs review (70/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-spark big-data data-pipeline data-pipelines databricks dataproc

1kbgz/tributary

Streaming reactive and dataflow graphs in Python

Category
vector dbs and data
Stars
466
Readiness
needs review (63/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

asynchronous data-pipeline kafka lazy-evaluation python python-data-streams

josephmachado/efficient_data_processing_spark

Code for "Efficient Data Processing in Spark" Course

Category
vector dbs and data
Stars
392
Readiness
needs review (61/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-spark data-engineering data-pipeline minio pyspark pyspark-notebook

DataWithBaraa/databricks_bootcamp_2026

End-to-end Data Lakehouse project built on Databricks, following the Medallion Architecture (Bronze, Silver, Gold). Covers real-world data engineering and analytics workflows using Spark, PySpark, SQL

Category
vector dbs and data
Stars
380
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 200 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai apache-spark data-analytics data-engineering data-engineering-project data-lakehouse

msamogh/nonechucks

Deal with bad samples in your dataset dynamically, use Transforms as Filters, and more!

Category
vector dbs and data
Stars
378
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 1415 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-cleaning data-pipeline data-preprocessing data-processing machine-learning preprocessing

airscholar/e2e-data-engineering

An end-to-end data engineering pipeline that orchestrates data ingestion, processing, and storage using Apache Airflow, Python, Apache Kafka, Apache Zookeeper, Apache Spark, and Cassandra. All compone

Category
vector dbs and data
Stars
338
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 539 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-airflow apache-kafka apache-spark apache-zookeeper big-data cassandra

lightfeed/extractor

Use LLMs to robustly extract web data

Category
vector dbs and data
Stars
320
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-agents article-extractor crawler data-engineering data-pipeline ecommerce-scraping

cuebook/cuelake

Use SQL to build ELT pipelines on a data lakehouse.

Category
vector dbs and data
Stars
290
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 1535 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-iceberg apache-spark data-engineering data-ingestion data-integration data-lake

ubisoft/mobydq

:whale: Tool to automate data quality checks on data pipelines

Category
vector dbs and data
Stars
257
Readiness
needs review (61/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1427 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data data-pipeline data-quality data-quality-checks data-quality-monitoring data-warehouse

scicloj/scicloj.ml

A Clojure machine learning library

Category
vector dbs and data
Stars
238
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
100/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: repository is archived, no push in 278 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

classification clojure clustering data-pipeline data-science experiment-tracking

airscholar/RedditDataEngineering

This project provides a comprehensive data pipeline solution to extract, transform, and load (ETL) Reddit data into a Redshift data warehouse. The pipeline leverages a combination of tools and service

Category
vector dbs and data
Stars
227
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1019 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-airflow aws celery data-pipeline end-to-end-data-engineering reddit

InfuseAI/awesome-public-dbt-projects

A curated list of awesome public DBT projects

Category
vector dbs and data
Stars
208
Readiness
high risk (43/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load. Risks: no push in 953 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-pipeline dbt transformation

MatsMoll/aligned

The DBT of ML, as Aligned describes data dependencies in ML systems, and reduce technical data debt

Category
vector dbs and data
Stars
61
Readiness
needs review (66/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai data-contracts data-lake datacontracts dbt feature-engineering

scylladb/scylladb-feature-store

Feature store sample applications built with ScyllaDB

Category
vector dbs and data
Stars
21
Readiness
needs review (70/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai feast feature-store low-latency real-time scylladb

mta-tech/seeknal

Seeknal is an all-in-one platform for data and AI/ML engineering

Category
vector dbs and data
Stars
9
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics-engineering data-engineering data-science duckdb feature-engineering feature-management

alibaba/feathub

FeatHub - A stream-batch unified feature store for real-time machine learning

Category
vector dbs and data
Stars
350
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: documentation, license. Risks: no push in 802 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-flink data data-engineering data-quality data-science feature-engineering

quintoandar/butterfree

A tool for building feature stores.

Category
vector dbs and data
Stars
319
Readiness
needs review (55/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 197 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-science etl etl-framework feature-store package

george0st/qgate-sln-mlrun

MLRun/Iguazio/Nuclio quality gate solution. The solution checks a quality of MLRun implementation/delivery.

Category
vector dbs and data
Stars
302
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 367 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

artificial-intelligence data-science e2e feature-store genai iguazio

inlinedio/ikv-store

High-performance key-value store for ML inference. 100x faster than Redis.

Category
vector dbs and data
Stars
224
Readiness
needs review (49/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, documentation, license. Risks: no push in 815 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cache database feature-store key-value-store machine-learning rust

serodriguez68/designing-ml-systems-summary

A detailed summary of "Designing Machine Learning Systems" by Chip Huyen. This book gives you and end-to-end view of all the steps required to build AND OPERATE ML products in production. It is a must

Category
vector dbs and data
Stars
205
Readiness
needs review (47/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1251 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

artificial-intelligence data-distribution feature-engineering feature-store machine-learning mlops

apache/superset

Apache Superset is a Data Visualization and Data Exploration Platform

Category
vector dbs and data
Stars
74,178
Readiness
ready (99/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +98 stars in 7 days; 100+ commits in 30 days

Why it may be a gem: consistent human and community activity; healthy maintenance and project fundamentals

Strongest signals: push recency, commit activity, contributor breadth. Risks: None identified. Missing inputs: None.

Capped lower bounds: 30-day commits, lifetime contributors, response activity.

analytics apache apache-superset asf bi business-analytics

andkret/Cookbook

The Data Engineering Cookbook

Category
vector dbs and data
Stars
15,204
Readiness
ready (87/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +15 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

best-practices big-data cookbook data-engineer data-engineering

xonsh/xonsh

🐚 Python-powered shell. Full-featured, cross-platform and AI-friendly.

Category
vector dbs and data
Stars
9,592
Readiness
ready (81/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +13 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

anthropic claude claude-code cmux data-engineering data-scientists

risingwavelabs/risingwave

Event streaming platform for agentic AI. Continuously ingest, transform, and serve event streams in real time, at scale.

Category
vector dbs and data
Stars
9,227
Readiness
ready (88/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +26 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-iceberg data-engineering database etl-pipeline event-streaming kafka

mage-ai/mage-ai

🧙 Build, run, and manage data pipelines for integrating and transforming data.

Category
vector dbs and data
Stars
8,789
Readiness
ready (86/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +9 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

artificial-intelligence data data-engineering data-integration data-pipelines data-science

redpanda-data/connect

Fancy stream processing made operationally mundane

Category
vector dbs and data
Stars
8,727
Readiness
ready (80/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +6 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

amqp cqrs data-engineering data-ops etl event-sourcing

growthbook/growthbook

Open Source Feature Flags, Experimentation, and Product Analytics

Category
vector dbs and data
Stars
8,105
Readiness
ready (82/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +26 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ab-testing abtest abtesting analytics bigquery clickhouse

cloudquery/cloudquery

Data pipelines for cloud config and security data. Build cloud asset inventory, CSPM, FinOps, and vulnerability management solutions. Extract from AWS, Azure, GCP, and 70+ cloud and SaaS sources.

Category
vector dbs and data
Stars
6,479
Readiness
ready (82/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +8 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airbyte attack-surface-management aws azure bigquery cspm

dlt-hub/dlt

data load tool (dlt) is an open source Python library that makes data loading easy 🛠️

Category
vector dbs and data
Stars
5,717
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +36 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-engineering data-lake data-loading data-warehouse elt

treeverse/lakeFS

lakeFS - Data version control for your data lake | Git for data

Category
vector dbs and data
Stars
5,483
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-spark apache-sparksql aws-s3 azure-blob-storage azure-storage data-engineering

aws/aws-sdk-pandas

pandas on AWS - Easy integration with Athena, Glue, Redshift, Timestream, Neptune, OpenSearch, QuickSight, Chime, CloudWatchLogs, DynamoDB, EMR, SecretManager, PostgreSQL, MySQL, SQLServer and S3 (Par

Category
vector dbs and data
Stars
4,116
Readiness
ready (95/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

amazon-athena amazon-sagemaker-notebook apache-arrow apache-parquet athena aws

dathere/qsv

Blazing-fast Data-Wrangling toolkit

Category
vector dbs and data
Stars
3,747
Readiness
ready (80/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +11 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai ckan csv data-engineering data-wrangling dcat

lakehq/sail

Drop-in Apache Spark replacement written in Rust, unifying batch processing, stream processing, and compute-intensive AI workloads.

Category
vector dbs and data
Stars
3,274
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +37 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-iceberg apache-spark arrow artificial-intelligence big-data data-engineering

apache/devlake

Apache DevLake is an open-source dev data platform to ingest, analyze, and visualize the fragmented data from DevOps tools, extracting insights for engineering excellence, developer experience, and co

Category
vector dbs and data
Stars
3,096
Readiness
ready (100/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +6 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

dashboard-friendly data data-analysis data-engineering data-integration data-transfers

meltano/meltano

Meltano: the declarative code-first data integration engine that powers your wildest data and ML-powered product ideas. Say goodbye to writing, maintaining, and scaling your own API integrations.

Category
vector dbs and data
Stars
2,584
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +7 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

connectors data data-engineering data-pipelines dataops dataops-platform

sodadata/soda-core

Data Contracts engine for the modern data stack. https://www.soda.io

Category
vector dbs and data
Stars
2,406
Readiness
ready (82/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-contracts data-engineering data-governance data-monitoring data-observability data-profiling

semantica-agi/semantica

Graph-Native Infrastructure for Context and Accountable AI Systems

Category
vector dbs and data
Stars
2,352
Readiness
ready (94/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +903 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent-memory ai ai-governance ai-infrastructure artificial-intelligence context-engineering

Zleap-AI/SAG

A new SOTA for RAG — an original retrieval architecture and an open-source knowledge base for humans and agents.

Category
vector dbs and data
Stars
2,303
Readiness
ready (90/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +32 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent ai data-engineering graphrag knowledge-base knowledge-graph

data-engineering-community/data-engineering-wiki

The best place to learn data engineering. Built and maintained by the data engineering community.

Category
vector dbs and data
Stars
2,014
Readiness
ready (79/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +6 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-engineer data-engineering data-modeling data-pipelines database

Hiflylabs/awesome-dbt

A curated list of awesome dbt resources

Category
vector dbs and data
Stars
1,715
Readiness
ready (84/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +6 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics-engineering awesome awesome-list data-engineering dbt

benthecoder/yt-channels-DS-AI-ML-CS

A comprehensive list of 180+ YouTube Channels for Data Science, Data Engineering, Machine Learning, Deep learning, Computer Science, programming, software engineering, etc.

Category
vector dbs and data
Stars
1,619
Readiness
needs review (68/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai artificial-intelligence awesome awesome-list coding data

quixio/quix-streams

Python Streaming DataFrames for Kafka

Category
vector dbs and data
Stars
1,567
Readiness
ready (90/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-intensive-applications data-science event-driven-architecture kafka machine-learning

getnao/nao

👾 nao is an open source analytics agent. (1) Create context with nao-core cli, (2) deploy nao chat interface for everyone

Category
vector dbs and data
Stars
1,507
Readiness
ready (84/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +48 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agentic-analytics analytics analytics-engineering bigquery business-intelligence chat-with-your-data

pyjanitor-devs/pyjanitor

Clean APIs for data cleaning. Python implementation of R package Janitor

Category
vector dbs and data
Stars
1,499
Readiness
ready (81/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cleaning-data data data-engineering dataframe hacktoberfest pandas

quiltdata/quilt

Quilt is a Scientific Data Management Platform on AWS that helps teams and AI find, trust, and reuse data through deeply versioned, context-rich data packages.

Category
vector dbs and data
Stars
1,368
Readiness
ready (88/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-engineering data-version-control data-versioning parquet python

bitol-io/open-data-contract-standard

Home of the Open Data Contract Standard (ODCS).

Category
vector dbs and data
Stars
1,072
Readiness
ready (90/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +10 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-contract data-contracts data-engineering data-mesh data-quality

odpi/egeria

Egeria core

Category
vector dbs and data
Stars
920
Readiness
ready (99/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-governance egeria governance hacktoberfest java

bacalhau-project/bacalhau

Community-driven, simple, yet powerful framework for fast, cost-effective distributed Compute over Data.

Category
vector dbs and data
Stars
867
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-art ai-data-collection ai-pipeline batch-processing bioinformatics-pipeline data-analysis

nordquant/complete-dbt-bootcamp-zero-to-hero

Supplementary Materials for the The Complete dbt (Data Build Tool) Bootcamp Udemy course

Category
vector dbs and data
Stars
819
Readiness
ready (80/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics-engineering data-engineering dbt dbt-packages

Nike-Inc/koheesio

Python framework for building efficient data pipelines. It promotes modularity and collaboration, enabling the creation of complex pipelines from simple, reusable components.

Category
vector dbs and data
Stars
817
Readiness
ready (85/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering delta-lake pydantic pyspark python

AltimateAI/altimate-code

Open-source agentic data engineering harness for dbt, SQL, and cloud warehouses. 100+ tools, 10 warehouses, AI-powered.

Category
vector dbs and data
Stars
793
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent agentic-data-engineering ai analytics-engineering bigquery cli

datavane/datavines

Know your data better!Datavines is Next-gen Data Observability Platform, support metadata manage and data quality.

Category
vector dbs and data
Stars
757
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cleandata data-engineering data-profilers data-profiling data-quality data-quality-checks

risesoft-y9/DataFlow-Engine

数据流引擎是一款面向数据集成、数据同步、数据交换、数据共享、任务配置、任务调度的底层数据驱动引擎。数据流引擎采用管执分离、多流层、插件库等体系应对大规模数据任务、数据高频上报、数据高频采集、异构数据兼容的实际数据问题。

Category
vector dbs and data
Stars
696
Readiness
ready (77/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering dataflow-programming docker jackson java kafka

insitro/redun

Yet another redundant workflow engine

Category
vector dbs and data
Stars
597
Readiness
ready (77/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

aws bioinformatics data-engineering data-science docker etl

kimtth/software-architect-mindmap

🧠Mindmap of 🗺️Software Architecture, Software engineering: An Overview of Software Terminologies and Concepts.

Category
vector dbs and data
Stars
526
Readiness
ready (87/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

architectural-patterns architecture aws azure data-engineering datascience

Desbordante/desbordante-core

Desbordante is a high-performance data profiler that is capable of discovering many different patterns in data using various algorithms. It also allows to run data cleaning scenarios using these algor

Category
vector dbs and data
Stars
493
Readiness
ready (87/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +1 stars in 7 days; 55 commits in 30 days

Why it may be a gem: consistent human and community activity; healthy maintenance and project fundamentals; open issue backlog is stable or shrinking

Strongest signals: push recency, commit activity, contributor breadth. Risks: None identified. Missing inputs: None.

Capped lower bounds: response activity.

anomaly-detection correlations data-analytics data-cleaning data-cleansing data-engineering

vmware/versatile-data-kit

One framework to develop, deploy and operate data workflows with Python and SQL.

Category
vector dbs and data
Stars
488
Readiness
needs review (61/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
watch
Maintenance risk
20/100 · high confidence

Why: +1 stars in 7 days; 37 lifetime contributors

Why it may be a gem: healthy maintenance and project fundamentals; open issue backlog is stable or shrinking

Strongest signals: push recency, contributor breadth, documentation. Risks: latest release is 891 days old, no pull-request review responses in 30 days. Missing inputs: None.

analytics data data-engineer data-engineering data-engineering-pipeline data-lineage

DataRecce/recce

The data-validation toolkit for enhanced dbt (data build tool) PR review

Category
vector dbs and data
Stars
469
Readiness
ready (93/100 heuristic points; not a probability)
Data confidence
high
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +3 stars in 7 days; 80 commits in 30 days

Why it may be a gem: consistent human and community activity; healthy maintenance and project fundamentals; open issue backlog is stable or shrinking

Strongest signals: push recency, commit activity, contributor breadth. Risks: None identified. Missing inputs: None.

analytics-engineering data data-engineering data-validation dataops dbt

dagster-io/dagster-open-platform

Dagster Labs' open-source data platform, built with Dagster.

Category
vector dbs and data
Stars
467
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
medium
Maintainer health
healthy
Maintenance risk
0/100 · high confidence

Why: +1 stars in 7 days; 13 commits in 30 days

Why it may be a gem: limited evidence; inspect maintenance signals before adopting

Strongest signals: push recency, issue load. Risks: maintenance is concentrated in one contributor. Missing inputs: release recency.

dagster data-engineering python

Paradigmllc/gspread-pandas

Read and write Google Sheets as pandas DataFrames — column-matched appends, real dtypes, and layout detection for sheets that don't start at A1.

Category
vector dbs and data
Stars
412
Readiness
ready (94/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-analytics data-engineering data-science dataframe dataframes

Snowflake-Labs/snowflake-demo-notebooks

Collection of Snowflake Notebook demos, tutorials, and examples

Category
vector dbs and data
Stars
372
Readiness
ready (97/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-science machine-learning notebook python sql

airbytehq/PyAirbyte

PyAirbyte brings the power of Airbyte to every Python developer. Powers the Airbyte Cloud Replication MCP.

Category
vector dbs and data
Stars
342
Readiness
needs review (71/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering elt python

dbt-labs/jaffle-shop

🥪🦘 An open source sandbox project exploring dbt workflows via a fictional sandwich shop's data.

Category
vector dbs and data
Stars
339
Readiness
ready (80/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics analytics-engineering data data-engineering dbt dbt-cloud

snowflakedb/snowpark-python

Snowflake Snowpark Python API

Category
vector dbs and data
Stars
339
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-analytics data-engineering data-science dataframe python snowflake

mprove-io/mprove

Open Source Agentic Business Intelligence with Malloy Semantic Layer :tada:

Category
vector dbs and data
Stars
338
Readiness
ready (88/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics bigquery business-intelligence dashboard data-engineering googleanalytics

sderosiaux/every-single-day-i-tldr

A daily digest of the articles or videos I've found interesting, that I want to share with you.

Category
vector dbs and data
Stars
327
Readiness
needs review (71/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

akka architecture bigdata category-theory data-engineering ddd

kanton-bern/hellodata-be

The Open-Source Enterprise Data Platform in a single Portal

Category
vector dbs and data
Stars
266
Readiness
ready (74/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering

starburstdata/dbt-trino

The Trino (https://trino.io/) adapter plugin for dbt (https://getdbt.com)

Category
vector dbs and data
Stars
263
Readiness
ready (89/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics-engineering data-engineering dbt python sql starburst

dbt-msft/dbt-sqlserver

dbt adapter for SQL Server and Azure SQL

Category
vector dbs and data
Stars
254
Readiness
ready (98/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics-engineering azure-sql azure-sql-db data-engineering dbt dbt-sqlserver

jrlasak/databricks-code-practice

Practice Databricks coding skills with hands-on exercises. Import into Databricks Free Edition, write code, run assertions, check pass/fail. Covers Delta Lake, Spark SQL, PySpark, Auto Loader, medalli

Category
vector dbs and data
Stars
244
Readiness
ready (85/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

auto-loader coding-practice data-engineering databricks databricks-certification delta-lake

datajoint/datajoint-python

Relational Workflows: where database schemas define executable data pipelines.

Category
vector dbs and data
Stars
195
Readiness
ready (94/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, fork interest. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-integrity data-lineage data-pipelines data-provenance datajoint

dagster-io/skills

A collection of AI skills for working with Dagster

Category
vector dbs and data
Stars
195
Readiness
ready (91/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: push recency, issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-tools claude-code dagster data-engineering data-orchestration marketplace

GoogleCloudPlatform/public-datasets-pipelines

Cloud-native, data onboarding architecture for Google Cloud Datasets

Category
vector dbs and data
Stars
179
Readiness
needs review (66/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: strong signals despite limited visibility; healthy maintenance and project fundamentals

Strongest signals: fork interest, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow bigquery cloud-composer cloud-native cloud-storage data-architecture

DataTalksClub/data-engineering-zoomcamp

Data Engineering Zoomcamp is a free 9-week course on building production-ready data pipelines. The next cohort starts in January 2026. Join the course here 👇🏼

Category
vector dbs and data
Stars
44,401
Readiness
high risk (44/100 heuristic points; not a probability)
Data confidence
medium
Maintainer health
watch
Maintenance risk
18/100 · high confidence

Why: +210 stars in 7 days; 100+ lifetime contributors

Why it may be a gem: open issue backlog is stable or shrinking

Strongest signals: contributor breadth, issue load, fork interest. Risks: recent commit cadence is 0/19.8 of its monthly baseline. Missing inputs: release recency.

Capped lower bounds: lifetime contributors.

course data-engineering dbt docker free kafka

eugeneyan/applied-ml

📚 Papers & tech blogs by companies sharing their work on data science & machine learning in production.

Category
vector dbs and data
Stars
29,999
Readiness
needs review (47/100 heuristic points; not a probability)
Data confidence
medium
Maintainer health
risky
Maintenance risk
30/100 · high confidence

Why: +25 stars in 7 days; 46 lifetime contributors

Why it may be a gem: open issue backlog is stable or shrinking

Strongest signals: contributor breadth, issue load, documentation. Risks: no push in 750 days. Missing inputs: release recency.

applied-data-science applied-machine-learning computer-vision data-discovery data-engineering data-quality

datastacktv/data-engineer-roadmap

Roadmap to becoming a data engineer in 2021

Category
vector dbs and data
Stars
12,750
Readiness
high risk (40/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 1655 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

cloud data-engineer-roadmap data-engineering roadmap

evidence-dev/evidence

Business intelligence as code: build fast, interactive data visualizations in SQL and markdown

Category
vector dbs and data
Stars
6,833
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
28/100 · low confidence

Why: +33 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 170 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics business-intelligence dashboard data-engineering data-science data-visualization

ruc-datalab/DeepAnalyze

DeepAnalyze is the first agentic LLM for autonomous data science. 🎈你的AI数据分析师,自动分析大量数据,一键生成专业分析报告!

Category
vector dbs and data
Stars
4,437
Readiness
ready (72/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

agent agentic agentic-ai ai ai-scientist chatbot

Moataz-Elmesmary/Data-Science-Roadmap

Data Science Roadmap from A to Z

Category
vector dbs and data
Stars
4,334
Readiness
needs review (57/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 244 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data chatgpt cheatsheet cv-template data-analysis data-engineering

whoiskatrin/sql-translator

SQL Translator is a tool for converting natural language queries into SQL code using artificial intelligence. This project is 100% free and open source.

Category
vector dbs and data
Stars
4,323
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 398 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-analysis data-engineering dataquery datascience dataset openai

gunnarmorling/awesome-opensource-data-engineering

An Awesome List of Open-Source Data Engineering Projects

Category
vector dbs and data
Stars
3,261
Readiness
high risk (43/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
28/100 · low confidence

Why: +9 stars in 7 days

Why it may be a gem: limited evidence; inspect maintenance signals before adopting

Strongest signals: issue load. Risks: no push in 672 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

awesome-list data-engineering

datafold/data-diff

Compare tables within or across databases

Category
vector dbs and data
Stars
2,987
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
100/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: repository is archived, no push in 812 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-diffing data-engineering data-quality data-quality-monitoring data-science

metarank/metarank

A low code Machine Learning personalized ranking service for articles, listings, search results, recommendations that boosts user engagement. A friendly Learn-to-Rank engine

Category
vector dbs and data
Stars
2,430
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 317 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

automl data-engineering data-science deep-learning feature-engineering feature-extraction

running-elephant/datart

Datart is a next generation Data Visualization Open Platform

Category
vector dbs and data
Stars
2,298
Readiness
needs review (59/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 543 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics bi business-analytics business-intelligence chart d3

AlexIoannides/pyspark-example-project

Implementing best practices for PySpark ETL jobs and applications.

Category
vector dbs and data
Stars
2,120
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
100/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: repository is archived, no push in 1314 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-science etl etl-job etl-pipeline pyspark

bytewax/bytewax

Python Stream Processing

Category
vector dbs and data
Stars
2,041
Readiness
needs review (59/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-processing data-science dataflow machine-learning python

san089/Udacity-Data-Engineering-Projects

Few projects related to Data Engineering including Data Modeling, Infrastructure setup on cloud, Data Warehousing and Data Lake development.

Category
vector dbs and data
Stars
1,961
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +4 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1443 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow airflow-operators aws aws-ec2 aws-s3 aws-sdk

OBenner/data-engineering-interview-questions

More than 2000+ Data engineer interview questions.

Category
vector dbs and data
Stars
1,705
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 206 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow avro aws azure cassandra data-engineering

kantord/just-dashboard

:bar_chart: :clipboard: Dashboards using YAML or JSON files

Category
vector dbs and data
Stars
1,581
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
28/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 167 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data business-intelligence chart csv d3 d3js

san089/goodreads_etl_pipeline

An end-to-end GoodReads Data Pipeline for Building Data Lake, Data Warehouse and Analytics Platform.

Category
vector dbs and data
Stars
1,537
Readiness
needs review (58/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 2343 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow airflow-dag apache-airflow apache-spark data-engineering data-engineering-pipeline

pyper-dev/pyper

Concurrent Python made simple

Category
vector dbs and data
Stars
1,519
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 549 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

asyncio concurrency data data-collection data-engineering data-pipelines

DataWithBaraa/sql-ultimate-course

The most comprehensive SQL guide from a real-world expert! Learn everything from basics to advanced queries, optimizations, and real-world SQL

Category
vector dbs and data
Stars
1,321
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
25/100 · low confidence

Why: +15 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 457 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-analytics data-engineering data-science database database-management

ashishps1/awesome-engineering-articles

A curated collection of 300+ engineering blog articles from top tech companies. Learn how the best engineering teams solve real-world problems at scale.

Category
vector dbs and data
Stars
1,161
Readiness
needs review (58/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
0/100 · low confidence

Why: +17 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai data-engineering database distributed-systems engineering infrastructure

daochenzha/data-centric-AI

A curated, but incomplete, list of data-centric AI resources.

Category
vector dbs and data
Stars
1,154
Readiness
high risk (40/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 772 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai artificial-intelligence data-centric data-centric-ai data-centric-machine-learning data-curation

alanchn31/Data-Engineering-Projects

Personal Data Engineering Projects

Category
vector dbs and data
Stars
1,025
Readiness
needs review (47/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: limited evidence; inspect maintenance signals before adopting

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1277 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow aws-redshift cassandra data-engineering data-engineering-nanodegree data-lake

CloudWise-OpenSource/FlyFish

FlyFish is a data visualization coding platform. We can create a data model quickly in a simple way, and quickly generate a set of data visualization solutions by dragging.

Category
vector dbs and data
Stars
958
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 787 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics business-analytics charts data-analysis data-analysis-python data-engineering

yobulkdev/yobulkdev

🔥 🔥 🔥Open Source & AI driven Data Onboarding Platform:Free flatfile.com alternative

Category
vector dbs and data
Stars
912
Readiness
high risk (42/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 1100 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

csv-import csv-parser csv-reader data-engineering datacleaning embeddable

ankurchavda/streamify

A data engineering project with Kafka, Spark Streaming, dbt, Docker, Airflow, Terraform, GCP and much more!

Category
vector dbs and data
Stars
894
Readiness
needs review (48/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1574 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow data-engineering dbt gcp kafka python

natayadev/dataengineering-roadmap

Un repositorio más con conceptos básicos, desafíos técnicos y recursos sobre ingeniería de datos en español 🧙✨

Category
vector dbs and data
Stars
894
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
27/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 161 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai big-data data data-engineering ingenieria-de-datos pipelines

DataWithBaraa/sql-data-warehouse-project

A comprehensive guide to building a modern data warehouse with SQL Server, including ETL processes, data modeling, and analytics.

Category
vector dbs and data
Stars
878
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +15 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 471 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-analysis data-analytics data-cleaning data-engineering data-lakehouse data-science

oleg-agapov/data-engineering-book

Accumulated knowledge and experience in the field of Data Engineering

Category
vector dbs and data
Stars
874
Readiness
high risk (38/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load. Risks: no push in 1354 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-engineering engineering

automaticmode/active_workflow

Polyglot workflows without leaving the comfort of your technology stack.

Category
vector dbs and data
Stars
866
Readiness
needs review (45/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 1222 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

activeworkflow agents data-engineering data-ops event-driven ifttt

stitchfix/hamilton

A scalable general purpose micro-framework for defining dataflows. THIS REPOSITORY HAS BEEN MOVED TO www.github.com/dagworks-inc/hamilton

Category
vector dbs and data
Stars
861
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
100/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: repository is archived, no push in 1131 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

dag data-engineering data-platform data-science dataframe etl

unytics/bigfunctions

Supercharge BigQuery with BigFunctions

Category
vector dbs and data
Stars
759
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
19/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 116 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bigquery data data-analytics data-engineering data-visualization data-warehouse

kennethleungty/Failed-ML

Compilation of high-profile real-world examples of failed machine learning projects

Category
vector dbs and data
Stars
753
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 784 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai artificial-intelligence classification computer-vision data-engineering data-quality

synmetrix/synmetrix

Synmetrix – production-ready open source semantic layer on Cube

Category
vector dbs and data
Stars
622
Readiness
high risk (44/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 546 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data bigquery business-intelligence clickhouse cube cubejs

apecloud/myduckserver

Unified MySQL, Postgres & FlightSQL Server, Powered by DuckDB.

Category
vector dbs and data
Stars
581
Readiness
needs review (51/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 567 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics arrow business-analytics business-intelligence columnar-storage data-engineering

data-burst/data-engineering-roadmap

No description

Category
vector dbs and data
Stars
493
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 463 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-engineering-roadmap dataengineering roadmap

paypal/data-contract-template

Template for a data contract used in a data mesh.

Category
vector dbs and data
Stars
492
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 877 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data data-contract data-engineering data-mesh

Titan-Systems/titan

Titan Core - Snowflake infrastructure-as-code. Provision environments, automate deploys, CI/CD. Manage RBAC, users, roles, and data access. Declarative Python Resource API. Change Management tool for

Category
vector dbs and data
Stars
486
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +2 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 512 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

compliance-as-code data-engineering data-governance data-warehouse dataops devops

aws-solutions-library-samples/data-lakes-on-aws

Enterprise-grade, production-hardened, serverless data lake on AWS

Category
vector dbs and data
Stars
483
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 310 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics aws best-practices data-engineering data-lake etl

blockchain-etl/bitcoin-etl

ETL scripts for Bitcoin, Litecoin, Dash, Zcash, Doge, Bitcoin Cash. Available in Google BigQuery https://goo.gl/oY5BCQ

Category
vector dbs and data
Stars
460
Readiness
needs review (61/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 462 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-beam bitcoin bitcoincash blockchain-analytics crypto cryptocurrency

blockchain-etl/ethereum-etl-airflow

Airflow DAGs for exporting, loading, and parsing the Ethereum blockchain data. How to get any Ethereum smart contract into BigQuery https://towardsdatascience.com/how-to-get-any-ethereum-smart-contrac

Category
vector dbs and data
Stars
440
Readiness
needs review (61/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 397 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

apache-airflow blockchain-analytics crypto cryptocurrency data-analytics data-engineering

moabukar/Everything-Tech

A collection of online resources to help you on your Tech journey.

Category
vector dbs and data
Stars
434
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
100/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: repository is archived, no push in 744 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ansible aws azure backend data-engineering data-science

kevintpeng/Learn-Something-Every-Day

📝 A compilation of everything that I learn; Computer Science, Software Development, Engineering, Math, and Coding in General. Read the rendered results here ->

Category
vector dbs and data
Stars
433
Readiness
high risk (42/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 1230 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

algorithm aws blog computer-science course-materials data-engineering

rdagumampan/yuniql

Free and open source schema versioning and database migration made natively with .NET/6. NEW THIS MAY 2022! v1.3.15 released!

Category
vector dbs and data
Stars
429
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 743 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

amazon-rds azure-sql-database data-engineering database-migrations datawarehouse dotnet-core

orbitalapi/orbital

Orbital automates integration between data sources (APIs, Databases, Queues and Functions). BFF's, API Composition and ETL pipelines that adapt as your specs change.

Category
vector dbs and data
Stars
360
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

api-gateway api-integration api-management bff bff-api data-engineering

dataplane-app/dataplane

Dataplane is an Airflow inspired unified data platform with additional data mesh and RPA capability to automate, schedule and design data pipelines and workflows. Dataplane is written in Golang with a

Category
vector dbs and data
Stars
357
Readiness
needs review (45/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
29/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 175 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow data data-analysis data-engineering data-integration data-pipelines

gabledata/recap

Work with your web service, database, and streaming schemas in a single format.

Category
vector dbs and data
Stars
350
Readiness
needs review (52/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 220 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-catalog data-discovery data-engineering data-integration data-pipelines etl

MelihGulum/Comprehensive-Data-Science-AI-Project-Portfolio

A curated collection of AI, data engineering, and DevOps projects featuring real-world applications, advanced techniques, and tutorials—ideal for learners and practitioners exploring data science and

Category
vector dbs and data
Stars
339
Readiness
high risk (44/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: +3 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai-project cloud-computing comprehensive data-engineering data-science deep-learning

ebonnal/streamable

sync/async iterable streams for Python

Category
vector dbs and data
Stars
330
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

asyncio collections concurrent-data-structure data data-engineering data-structures

Hamagistral/de-zoomcamp-ui

🎨 UI for the Free Data Engineering Zoomcamp Course provided by DataTalksClub

Category
vector dbs and data
Stars
320
Readiness
needs review (55/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

course data-engineering dbt docker google-cloud kafka

zero-one-group/geni

A Clojure dataframe library that runs on Spark

Category
vector dbs and data
Stars
294
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 983 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data clojure clojure-library clojure-repl data-engineering data-science

adidas/lakehouse-engine

The Lakehouse Engine is a configuration driven Spark framework, written in Python, serving as a scalable and distributed engine for several lakehouse algorithms, data flows and utilities for Data Prod

Category
vector dbs and data
Stars
293
Readiness
needs review (58/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

big-data configuration-driven data-engineering data-quality databricks delta-lake

morph-kgc/morph-kgc

Powerful RDF Knowledge Graph Generation with RML Mappings

Category
vector dbs and data
Stars
288
Readiness
needs review (70/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-integration database etl knowledge-graph python

Flor91/Data-engineering-nanodegree

Projects done in the Data Engineering Nanodegree by Udacity.com

Category
vector dbs and data
Stars
275
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

aws cassandra data-engineering data-modeling dimensional-model postgres

ris-tlp/audiophile-e2e-pipeline

Pipeline that extracts data from Crinacle's Headphone and InEarMonitor databases and finalizes data for a Metabase Dashboard. The dashboard is then used to support a purchasing decision of which Headp

Category
vector dbs and data
Stars
270
Readiness
needs review (49/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1314 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow aws data-engineering metabase python terraform

cnstlungu/portable-data-stack-dagster

A portable Datamart and Business Intelligence suite built with Docker, Dagster, dbt, DuckDB and Superset

Category
vector dbs and data
Stars
265
Readiness
needs review (58/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
21/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 124 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

business-intelligence dagster data-engineering data-visualization dbt duckdb

blockchain-etl/public-datasets

The list of public blockchain datasets in BigQuery

Category
vector dbs and data
Stars
258
Readiness
needs review (54/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation, license. Risks: no push in 772 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

bitcoin blockchain blockchain-analytics crypto cryptocurrency data-analytics

Amrit-Hub/Databricks-Certified-Data-Engineer-Associate-Questions

This repo contains "Databricks Certified Data Engineer Associate" Questions and related docs.

Category
vector dbs and data
Stars
254
Readiness
needs review (48/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 726 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

certification data-engineering databricks sql

DataWithBaraa/sql-data-analytics-project

This repository contains a collection of SQL scripts demonstrating various analytical techniques, such as changes over time, cumulative, performance, data segmentation, part-to-whole analysis.

Category
vector dbs and data
Stars
250
Readiness
needs review (62/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +5 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 499 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

analytics business-analytics business-intelligence data data-analysis data-analyst

GokuMohandas/data-engineering

Construct a modern data stack and orchestration the workflows to create high quality data for analytics and ML applications.

Category
vector dbs and data
Stars
250
Readiness
needs review (45/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 1425 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow data-engineering data-warehouse dbt etl machine-learning

alexklibisz/elastik-nearest-neighbors

Go to: https://github.com/alexklibisz/elastiknn

Category
vector dbs and data
Stars
248
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
100/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: repository is archived, no push in 2301 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering elasticsearch elasticsearch-plugin knn knn-algorithm locality-sensitive-hashing

hukenovs/coursera_ml_da_specialization

Coursera Specialization: Machine Learning and Data Analysis (Yandex & MIPT)

Category
vector dbs and data
Stars
242
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1500 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

certificates convolutional-neural-networks coursera data-engineering data-mining data-science

kelvins/awesome-dataops

:sunglasses: A curated list of awesome DataOps tools

Category
vector dbs and data
Stars
236
Readiness
needs review (45/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
0/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

awesome awesome-list data-engineer data-engineering dataops

kevinheavey/modern-polars

Code and data for the Modern Polars book

Category
vector dbs and data
Stars
234
Readiness
needs review (64/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
healthy
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-analytics data-engineering data-science dataengineering pandas polars

ocademy-ai/machine-learning

Learn AI together, for free. AI learning and teaching resources for everyone.

Category
vector dbs and data
Stars
230
Readiness
needs review (53/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: fork interest, documentation, license. Risks: no push in 795 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

ai data-engineering data-science deep-learning jupyter jupyter-notebook

Minyus/pipelinex

PipelineX: Python package to build ML pipelines for experimentation with Kedro, MLflow, and more

Category
vector dbs and data
Stars
228
Readiness
high risk (43/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
19/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals

Strongest signals: issue load, documentation. Risks: no push in 114 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-science deep-learning experimentation machine-learning pipeline

jitsucom/bulker

Service for bulk-loading data to databases with automatic schema management (Redshift, Snowflake, BigQuery, ClickHouse, Postgres, MySQL)

Category
vector dbs and data
Stars
224
Readiness
high risk (0/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
90/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, documentation, license. Risks: repository is archived, no push in 120 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering datawarehouse etl etl-pipeline ingestion pipeline

josephmachado/data_engineering_best_practices

Sample project to demonstrate data engineering best practices

Category
vector dbs and data
Stars
223
Readiness
needs review (48/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, fork interest, documentation. Risks: no push in 895 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering delta-lake etl great-expectations minio pyspark

kevin-hanselman/dud

A lightweight CLI tool for versioning data alongside source code and building data pipelines.

Category
vector dbs and data
Stars
220
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, documentation, license. Risks: no push in 376 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

data-engineering data-pipelines data-science dataset dvcs machine-learning

tomasfarias/airflow-dbt-python

A collection of Airflow operators, hooks, and utilities to elevate dbt to a first-class citizen of Airflow.

Category
vector dbs and data
Stars
215
Readiness
needs review (58/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
watch
Maintenance risk
0/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, fork interest, documentation. Risks: None identified. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow airflow-hook airflow-operators analytics data-engineering dbt

blockchain-etl/awesome-bigquery-views

Useful SQL queries for Blockchain ETL datasets in BigQuery.

Category
vector dbs and data
Stars
212
Readiness
needs review (58/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, documentation, license. Risks: no push in 1370 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

blockchain-analytics crypto cryptocurrency data-analytics data-engineering data-science

absognety/Interview-Process-Coding-Questions

Interview coding questions and experiences for several companies merged into one repository

Category
vector dbs and data
Stars
210
Readiness
needs review (50/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: +1 stars in 7 days

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, fork interest, documentation. Risks: no push in 248 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

adobe amazon bigdata data-engineering flipkart geeksforgeeks

andresionek91/airflow-autoscaling-ecs

Airflow Deployment on AWS ECS Fargate Using Cloudformation

Category
vector dbs and data
Stars
206
Readiness
needs review (61/100 heuristic points; not a probability)
Data confidence
low
Maintainer health
risky
Maintenance risk
30/100 · low confidence

Why: High-signal vector dbs and data project

Why it may be a gem: healthy maintenance and project fundamentals; strong signals despite limited visibility

Strongest signals: issue load, fork interest, documentation. Risks: no push in 1507 days. Missing inputs: commit activity, contributor breadth, release recency, response activity, maintenance distribution.

airflow airflow-autoscaling-ecs airflow-deployment airflow-ecs data-engineering