Crearé conjuntos de datos masivos para entrenamiento de IA
Desarrollador Python, Especialista en Extracción de Datos
Revisado por el equipo de Fiverr Pro
El equipo de Fiverr Pro seleccionó a Kawsar por su experiencia.
Revisado para
Extracción de datos
Procesamiento de datos
Acerca de este Servicio
Necesitas un conjunto de datos grande y limpio para entrenar o ajustar un modelo de IA, no un volcado de scraping desordenado ni un archivo de muestra pequeño.
Eso es lo que hago. Soy Kawsar, un desarrollador de Python que construye scraping de datos para conjuntos de datos masivos para entrenamiento de IA a partir de fuentes públicas, generación sintética y exportaciones estructuradas en CSV o JSON.
Lo que entrego:
- Conjuntos de datos personalizados para entrenamiento de IA ajustados a tu paquete y esquema
- Colección pública en la web y/o filas sintéticas cuando se necesita datos seguros en cuanto a privacidad
- CSV, JSON o Excel limpios listos para preparación de ML y LLM
- Mapeo de campos, deduplicación básica y un breve diccionario de datos
- Script de colección en Python opcional en Premium
- Muestras gratuitas de filas antes de la construcción completa para que apruebes el esquema primero
- Exportación en JSONL lista para ajuste fino de LLM (formatos OpenAI, Hugging Face y Llama)
Construyo datasets personalizados para equipos de ML y AI. El volumen depende del paquete y la dificultad de la fuente. Solo datos públicos.
Envíame tu esquema, volumen objetivo y caso de uso antes de ordenar.
NOTA:
- Sólo datos públicos. El comprador proporciona esquema y URLs objetivo al hacer scraping
- Construcción personalizada por pedido
- No se recolectan datos personales
- No se hacen tareas escolares o universitarias
Plataforma:
mySQL
•
PL/SQL
•
Postgresql
•
SQLite
•
SQL Server
Experiencia:
Diseño
•
Normalización
•
SQL
•
NoSQL
•
Rendimiento
Clientes con los cuales he trabajado
MyHeritage
Internet Software & Services
I've been hired to carry out certain web extraction-related jobs in order to build a database for user reviews, which will be used to develop the product and make changes in certain instances.
may 2022-may 2023
Fiverr
Internet Software & Services
The project was to gather a detailed list of 5000 keywords from various profession types and list their Google Rank, Link, and even Local Search Results, etc. Information and make a Report with these!
jul 2024
Mi porfolio
FAQ
Traducción automática
¿Qué tipo de conjuntos de datos creas?
Conjuntos de datos estructurados para entrenamiento de IA para preparación de ML y LLM: CSV/JSON tabular, corpus de texto y colecciones de fuentes públicas. La etiquetación de CV con muchas imágenes puede ajustarse si encaja.
¿Haces scraping en la web o generas datos sintéticos?
Ambos. Elegimos colección pública, generación sintética o una mezcla según tu esquema, necesidades de privacidad y volumen objetivo.
¿También entrenarás mi modelo?
Este gig es para crear el conjunto de datos. El entrenamiento del modelo y el ajuste fino de LLM son gigs separados si necesitas eso después.
¿Qué archivos obtengo?
CSV, JSON, JSONL o Excel más un breve diccionario de datos. Premium puede incluir un script en Python usado para construir o actualizar el conjunto.
¿Necesito proporcionar un esquema?
Sí. Envía nombres de columnas, etiquetas, formatos y filas de ejemplo si los tienes. Así el conjunto de datos estará listo para el modelo.
¿Incluye trabajo con LoRA o conjuntos de datos para influencers de IA?
No. Este gig es para datos de entrenamiento de ML/AI, no para paquetes LoRA de influencers.
¿Esto es para tareas escolares o universitarias?
No. No hago tareas escolares o universitarias.

