Cargaré conjuntos de datos de Hugging Face y kaggle en tu base de datos

Parte de la información se ha traducido automáticamente.

Pakistán

Hablo Inglés

11 pedidos completados

Ingeniero de datos con experiencia ¡Especialista en pipelines de datos! ¡Migración de datos!

¿Buscas transformar datos en bruto en insights poderosos? ¡Estás en el lugar correcto! Soy un ingeniero de datos con amplia experiencia en construir, migrar y optimizar pipelines de datos, especialmen...
Acerca de este Servicio

¿Necesitas un conjunto de datos público dentro de tu propia base de datos? Lo extraeré de Hugging Face, Kaggle o cualquier fuente de datos abiertos, lo limpiaré y lo cargaré en tu base de datos, data warehouse o almacenamiento en la nube, listo para consultar.


Lo que hago:

Extraer de Hugging Face, Kaggle, data.gov, AWS Open Data, conjuntos de datos públicos de BigQuery, APIs y archivos CSV, JSON o Parquet

Limpiar y transformar: corregir tipos de datos, aplanar JSON anidados, eliminar duplicados y filas corruptas

Cargar en PostgreSQL, MySQL, SQL Server, MongoDB, Supabase, BigQuery, Snowflake, Redshift, Databricks, S3, GCS o Azure

Transmitir grandes conjuntos de datos en lotes, por lo que el tamaño rara vez es un problema

Cargas incrementales y actualización programada con Airflow, GitHub Actions o cron

Conjuntos de datos de texto incrustados y cargados en pgvector, Pinecone o Qdrant para IA y RAG


Obtienes:

- Tablas listas para consultar en tu almacenamiento

- Código Python limpio y reutilizable

- Un README y un informe de validación (conteo de filas, esquema)


Verifico la licencia de cada conjunto de datos y señalo cualquier restricción antes de cargar.


¿No estás seguro de qué paquete se ajusta? Envíame el enlace del conjunto de datos y tu destino antes de ordenar, y te recomendaré uno.

Plataforma de destino:

Google BigQuery

•

Amazon Redshift

Herramientas y plataformas:

Fivetran

•

Airbyte

•

AWS Glue DataBrew