Ga naar de hoofdinhoud

[ 00 / 08 ]

[ PRIVATE ASSISTENTEN | UW DOCUMENTEN | UW INFRASTRUCTUUR ]

PRAKTISCH BEGINNEN. CONTROLE OVER UW DATA. RUIMTE OM TE GROEIEN.

SOEVEREINE AI | GEBOUWD VOOR UW BEDRIJF

Zet AI aan het werk. Houd controle over uw data.

Vind antwoorden in bedrijfsdocumenten, stel teksten op en zet AI aan het werk met uw bedrijfsdata, op uw eigen infrastructuur.

Voor kleine bedrijven en groeiende teams. We brengen hardware, modellen en integratie samen op basis van uw behoeften en budget.

BEGIN BIJ HET WERK DAT U WILT VERBETEREN

Minder zoeken. Minder routinewerk. Meer bruikbare AI.

Soevereine AI betekent bepalen waar uw data wordt verwerkt, wie erbij kan en van welke systemen u afhankelijk bent. Het vertrekpunt is een bruikbare bedrijfstoepassing, geen hardwarespecificatie.

Vind antwoorden in uw bedrijfskennis

Laat uw team handleidingen, procedures en projectdocumenten doorzoeken via een private assistent. We stemmen gegevenskoppelingen, toegangsrechten en bronverwijzingen af op de informatie die mensen nodig hebben.

Geef dagelijks werk een AI-assistent

Vat documenten samen, bereid conceptteksten voor en ondersteun klantopvolging. Verbind een private AI-omgeving met uw workflows, met AIDesk als één van de mogelijke toepassingen.

Ontdek de AIDesk-werkomgeving

Bouw en programmeer met lokale AI

Geef ontwikkelaars een intern AI-aansluitpunt voor codeerhulp en bedrijfstools. Kies een model voor uw taken en toets het met uw code, documenten en verwachte gebruikers.

OP MAAT, NIET STANDAARD OP RACKSCHAAL

Begin bij wat uw team nodig heeft, niet bij een cluster.

Een private assistent, documentzoekfunctie of lokaal codeermodel stelt andere eisen dan grootschalige training. We stemmen geheugen, rekenkracht, opslag en gelijktijdige gebruikers op elkaar af en toetsen het resultaat aan uw eigen taken.

Een lokaal AI-werkstation

Een gericht startpunt voor een individuele gebruiker of klein team. Verken lokale assistenten, codeerhulp en contentworkflows zonder een cluster aan te schaffen.

Een gedeelde on-prem AI-server

Voorzie interne toepassingen van AI via een lokale API. Stem GPU-geheugen en aanvraagcapaciteit af op de modellen, contextlengtes en responstijden die uw team nodig heeft.

Een onderbouwd groeipad

Breid uit wanneer bezetting en vraag dat rechtvaardigen. Voor workloads die compacte, krachtige multi-GPU-infrastructuur vereisen, hebben we een apart clusteraanbod.

Bekijk GPU-servers en clusters

EEN VOORBEELD, GEEN INVESTERING OP CLUSTERSCHAAL

Misschien volstaat één werkstation, geen datacenter.

Een Radeon AI PRO R9700 met 32 GB GPU-geheugen is één mogelijk startpunt voor een lokaal AI-werkstation. We kiezen het volledige systeem op basis van het model, de gebruikers en de gewenste responstijden. Een passend systeem is belangrijker dan de grootste GPU.

AI-gegenereerde conceptillustratie, geen foto van een fabrikant of exacte leveringsconfiguratie. Systeemconfiguratie en beschikbaarheid worden per project bevestigd; de calculator rekent met een volledig systeem, niet met de prijs van deze GPU.

MEER DAN EEN HARDWARELEVERING

Een werkende oplossing, geen verzameling onderdelen.

We werken een volledige uitrol uit: passende hardware, een ingesteld model met de software om het te draaien, toepassingskoppelingen en afspraken over het beheer. U weet wat inbegrepen is en wat vóór de uitrol aangetoond moet worden.

01 / Toets de toepassing

Begin met een taak, representatieve voorbeelden en de mensen die het systeem gaan gebruiken. Spreek af wat een bruikbaar antwoord is, hoe snel het moet komen en welke data verwerkt mag worden.

02 / Stem model en systeem op elkaar af

Kies model en hardware samen. Waar zinvol verlaagt kwantisatie het modelgeheugengebruik en stemt fine-tuning het gedrag af op een specifieke taak. We toetsen het resultaat, in plaats van aan te nemen dat een kleiner model volstaat.

03 / Koppel en draag over

Koppel uw toepassingen, test echte aanvragen en gelijktijdige gebruikers en documenteer de opzet. Maak afspraken over toegang, updates, monitoring, back-upverantwoordelijkheden en ondersteuning voordat het systeem dagelijks wordt gebruikt.

GEBOUWD OP PRAKTIJKERVARING

Lokale inferentie, onderbouwd met openbaar werk.

Onze openbare paiton-vllm-plugin brengt Paiton-uitvoering naar vLLM. De huidige Radeon-focus ligt op RDNA 4 met de Radeon AI PRO R9700. Ondersteuning geldt voor de gedocumenteerde model- en hardwareprofielen, niet voor elk model op elke GPU.

paiton-vllm-plugin

Bekijk de openbare integratie, ondersteunde profielen en installatie-instructies. De Paiton-compiler blijft bedrijfseigen; openbare componenten hebben hun eigen licenties.

Bekijk de GitHub-repository

GGUF binnen vLLM, op één Radeon

Een getest lokaal AI-aansluitpunt voor tekst en beeld met de oorspronkelijke GGUF-gewichten. Lees de meetresultaten en de grenzen van deze configuratie.

Lees de benchmark voor lokale inferentie

Paiton-prestatieoptimalisatie

Bekijk workloadspecifieke resultaten voor taal-, beeld- en videogeneratie. Metingen sturen onze systeemkeuzes, geen algemene snelheidsclaims.

Paiton

CLOUDTOKENS VERSUS EIGEN HARDWARE

Wat kan lokale AI u besparen?

Vul uw maandelijkse tokenvolume in. Vergelijk een cloud-API-factuur met de berekende kosten van één lokaal systeem, inclusief hardware, elektriciteit en doorlopend beheer.

Alle bedragen in EUR. Aanpasbare rekenaannames, geen hardwareofferte of gegarandeerde besparing.

Dit is een schatting en kan variëren naargelang het gebruik, het model en de geldende tarieven. Pas de tokenvolumes en prijzen aan uw situatie aan.

Aannames voor vermogen en capaciteit

Voorbeeldsnelheden, geen benchmarkclaims voor de R9700. Vervang ze door gemeten snelheden voor uw model, context en workload. Het systeem staat een maand van 30 dagen continu aan; ongebruikte uren tellen mee tegen het rustvermogen. De standaard 500 actieve uren laten ruimte voor pieken en onderhoud.

Een kostenscenario, geen benchmark tussen gelijkwaardige modellen. De clouddienst en het lokale systeem gebruiken verschillende modellen. Een lokaal model moet eerst voldoen aan uw eisen voor kwaliteit, context, beveiliging en gelijktijdig gebruik. Tokenaantallen kunnen per tokenizer verschillen.

Zo wordt dit berekend

Cloud = miljoenen inputtokens × inputtarief + miljoenen outputtokens × outputtarief. Lokaal = systeem- en installatiekosten ÷ gebruiksduur in maanden + elektriciteit bij actief gebruik en in rust + maandelijks beheer. Actieve uren = inputtokens ÷ inputsnelheid + outputtokens ÷ outputsnelheid, omgerekend naar uren. Terugverdientijd = investering ÷ (cloudfactuur min lokale elektriciteit en beheer).

Standaardtarieven voor tekst zonder caching; tel gefactureerde redeneertokens mee als output. Geen batchkortingen, cachetarieven, belastingen, financiering, restwaarde, cloudtools of netwerkkosten. Neem uitrol, evaluatie en fine-tuning mee in de installatiekosten, en koeling of doorlopende arbeidskosten waar nodig in beheer. Het model veronderstelt volledige lokale vervanging en een gelijkmatige maandvraag; responstijden bij pieken zijn niet gegarandeerd.

Omrekening met een vaste referentiekoers: € 1 = USD 1,1551 (14 september 2026). Geen live wisselkoers. ECB-referentiekoers

SOEVEREINITEIT ALS ONTWERPEIS

Behoud controle waar het telt.

Data en toegang

Bepaal waar prompts, documenten, resultaten en logs worden opgeslagen, wie erbij kan en welke netwerkverbindingen zijn toegestaan. Lokale inferentie kan aanvragen binnen uw eigen infrastructuur houden.

Modellen en afhankelijkheden

Beoordeel modellicenties, runtime-afhankelijkheden, telemetrie en updateprocedures. Modellen downloaden en software installeren kan nog externe toegang vereisen. Een offline uitrol vraagt om expliciete voorbereiding en tests.

Beheer en verantwoordelijkheid

Spreek af wie beveiliging, back-ups, patches en herstel verzorgt. On-prem hardware alleen garandeert geen soevereiniteit, veiligheid of naleving van regelgeving. Ook de manier van beheren moet aan uw vereisten voldoen.

ZO WERKT UW PRIVATE AI SAMEN

Binnen uw infrastructuur
  1. Uw toepassingen

    Documenten · Codeerhulp · Interne tools

  2. Uw private AI

    Geselecteerd model · Beveiligde toegang · Lokale verwerking

  3. Uw hardware

    Werkstation of on-prem server

Voorbeeldopzet. Toegang, logging en externe afhankelijkheden worden voor uw project bepaald.

EEN ONDERBOUWDE KEUZE, GEEN SPRONG IN HET DIEPE

Past lokale AI bij uw bedrijf?

Is lokale AI altijd goedkoper dan cloud-AI?

Nee. Regelmatig gebruik en duidelijke eisen aan datacontrole kunnen een lokaal systeem aantrekkelijk maken. Bij incidenteel gebruik of sterk wisselende vraag kan een clouddienst beter passen. Vergelijk hardware, elektriciteit, ondersteuning en modelkwaliteit, niet alleen de tokenprijs. De calculator is een eerste inschatting, geen besparingsgarantie.

Hebben we eigen AI-specialisten nodig?

U hoeft niet zelf de volledige technische omgeving te kiezen. ElioVP kan samen met u hardware, modellen en integratie uitwerken. Uw organisatie heeft wel een verantwoordelijke nodig voor de toepassing en de data, met projectafspraken over ondersteuning en beheer.

Kan het systeem draaien zonder prompts naar een AI-clouddienst te sturen?

Ja, bij een uitrol die voor lokale verwerking is ingericht. We beoordelen documentextractie, AI-verwerking, zoekindexen, logs en externe koppelingen. Volledig offline werken vraagt extra voorbereiding en tests. Een GPU installeren alleen creëert die afscherming niet.

Kan het alles wat een groot cloudmodel kan?

Niet noodzakelijk. Het passende model hangt af van taal, redeneren, documentlengte, tools en beschikbaar geheugen. We toetsen de taken die voor uw bedrijf belangrijk zijn en maken de afwegingen duidelijk voordat we een systeem adviseren.

Vertel ons wat u lokaal wilt draaien.

Vertel ons welke taak te veel tijd kost, hoeveel mensen toegang nodig hebben en wat privé moet blijven. Vermeld een budgetindicatie als u die heeft. We helpen een praktisch startpunt te bepalen en vast te leggen wat eerst getest moet worden.