Nuestra agencia desplegará IA auto alojada con open webui y rag


Agencia
Acerca de este Servicio
Traducción automática
¿Necesitas un asistente de IA que funcione en tu propia infraestructura, con tus propios documentos?
WZ-IT despliega stacks de LLM y RAG auto alojados para empresas que no pueden enviar datos internos a una API de EE. UU. Open WebUI como interfaz, LiteLLM como puerta de enlace, Qdrant o pgvector para recuperación, Langfuse para trazabilidad y control de costos.
Dependiendo del alcance, cubrimos:
- Open WebUI con SSO, grupos de usuarios y acceso a modelos por equipo
- Gateway LiteLLM: una API para modelos locales y externos, presupuestos por equipo
- inferencia vLLM u Ollama, ajustada a tu presupuesto de GPU o CPU
- pipeline RAG: ingestión, fragmentación, embeddings, Qdrant o pgvector
- recuperación con permisos para que los usuarios solo vean los documentos que pueden ver
- Langfuse para trazabilidad, evaluación y costos por equipo
- despliegue en tu servidor GPU, nube europea o en tus instalaciones
Lo difícil no es la ventana de chat. Es hacer que la recuperación respete los permisos que ya tienes y conocer el costo mensual real.
Comienza con la consulta: una hora con los fundadores de WZ-IT, además de una recomendación escrita que conservas de cualquier forma. Todo lo que sea más grande se cotiza como una oferta personalizada, ajustada a lo que realmente necesitas.
Más de nuestro trabajo: wz-it.com
Acerca de esta agencia

Agencia
3 empleados
- DeAlemania
- Miembro desdeoct 2019
- Responde aprox. en:1 hora
- Última entrega1 año
Idiomas
Alemán, Inglés, Holandés
Traducción automática
Porfolio
FAQ
Traducción automática
¿Qué modelo deberíamos usar?
Depende de la tarea, el idioma y el hardware. Los modelos pequeños de peso abierto manejan la mayoría de los asistentes internos; un modelo de 70B necesita un presupuesto serio de GPU. Lo ajustamos según tu caso de uso.
¿RAG respeta nuestros permisos existentes?
Solo si está construido así. El filtrado debe ocurrir antes de la búsqueda por vector, no pidiendo al modelo que se comporte. Esa es la esencia del paquete RAG Platform.
¿Necesitamos una GPU?
No siempre. Modelos pequeños y inferencia en CPU son viables con baja concurrencia. Te decimos en qué caso estás antes de que compres hardware.
¿Puedes conectarlo a Nextcloud o a un compartido de archivos?
Sí, como fuente de documentos en la pipeline de ingestión, incluyendo el mapeo de permisos.
4 comentarios sobre este Servicio
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Desglose de calificaciones
- Nivel de comunicación del Freelancer
- Recomendar a un amigo
- Servicio según lo descrito
Ordenar por
P pawelpavlo

Alemania
Very well and quickly executed order :) I recommend !!!
Útil?D dnlnrx
Cliente recurrente

Alemania
Exzellente Arbeit. 1A Kommunikation.
Útil?S sbroderman

Suecia
Perfect delivery!
Útil?S 
sangeorgean2
Cliente recurrente

Alemania
Super, thank you!
Útil?
4 comentarios sobre este Servicio
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Desglose de calificaciones
- Nivel de comunicación del Freelancer
- Recomendar a un amigo
- Servicio según lo descrito
Ordenar por
P pawelpavlo

Alemania
Very well and quickly executed order :) I recommend !!!
Útil?D dnlnrx
Cliente recurrente

Alemania
Exzellente Arbeit. 1A Kommunikation.
Útil?S sbroderman

Suecia
Perfect delivery!
Útil?S 
sangeorgean2
Cliente recurrente

Alemania
Super, thank you!
Útil?
