Expertise

Software-engineering.
Onderbouwd in de praktijk.

Kleine Koe werkt aan software, integraties, betrouwbaarheid en security. Negentien geaccepteerde bijdragen aan externe open-sourceprojecten en meerdere erkende kwetsbaarheidsmeldingen maken dat werk controleerbaar. Aanvullende expertise omvat lokale AI, vision-finetuning en beeldmeting, naast zeventien maanden professioneel LLM-evaluatiewerk via Scale AI-platforms (mei 2023–september 2024).

Automatisering in de praktijk

Meerdere overheidslekken gevonden én erkend.

Geautomatiseerd gevonden. Menselijk goedgekeurd.

Van openbaar signaal naar erkende melding
UitkomstMeerdere meldingen erkend

Kleine Koe ontwikkelde software die openbare bronnen automatisch doorzoekt op mogelijk blootgestelde toegangssleutels en onveilige instellingen. Bevindingen worden verzameld en klaargezet voor handmatige beoordeling.

Daarna neemt een mens het over: iedere vondst wordt gecontroleerd en pas na expliciete goedkeuring gemeld. We loggen nergens in, testen geen toegang en maken geen gebruik van de kwetsbaarheid.

De melding verloopt via Coordinated Vulnerability Disclosure (CVD): de betrokken organisatie krijgt de bevinding rechtstreeks en kan het probleem veilig onderzoeken en oplossen. Meerdere meldingen zijn door de betrokken overheidsorganisaties erkend.

  • Meerdere overheidslekken erkend
  • Automatisch gevonden
  • Handmatig gecontroleerd
  • Verantwoord gemeld

Zorgvuldig gevonden. Verantwoord gemeld.

Kleine Koe bewaart de onderliggende bevestigingen. Operationele details en informatie die misbruik kan vergemakkelijken worden niet gepubliceerd.

Ervaring in de praktijk

Van architectuur tot dagelijks gebruik.

Van API-integraties en foutafhandeling tot tests, monitoring en lokale infrastructuur. Hieronder staan concrete voorbeelden van het werk en de onafhankelijke technische feedback daarop, inclusief specialistisch werk aan AI-systemen.

19× upstream geaccepteerd

Negentien bijdragen zijn gemerged in externe open-sourceprojecten, verspreid over agents, officiële SDK's, modelruntimes, observability, cloudautoscaling en inference-loadtesting. Elke bijdrage is herleidbaar tot een PR, tests en review door de maintainers van het project.

Bekijk alle gemergede PR's

5× Qwen Code

Vijf onder externe review geaccepteerde wijzigingen aan een productie-agent, op het gebied van concurrency, authenticatie, kanaalrouting, toolgedrag en rate-limitafhandeling.

Bekijk de gemergede bijdragen

OpenAI .NET SDK

Twee bijdragen gemerged in OpenAI's officiële .NET SDK: correcte serialisatie van include-parameters voor Conversations en ondersteuning voor reasoning context in Responses, inclusief codegeneratie, API-oppervlak en regressietests.

OpenAI .NET #1255 · #1256

Cloud- & inferencebetrouwbaarheid

Recente merges in Ray en Kubernetes SIG inference-perf lossen respectievelijk een AWS key-pair-racecondition en een fout bij getimede loadgeneratie zonder workers op. Beide wijzigingen zijn met gerichte regressietests en volledige testsuites gevalideerd.

Ray #64738 · inference-perf #613

Lokale AI-runtimes

Geaccepteerde fixes in llama.cpp, LocalAI, Lemonade en llmfit voor configuratie, runtime-afhankelijkheden, backend-overrides en correcte Strix Halo-hardwareherkenning. Direct relevant voor betrouwbare lokale modeluitvoering en reproduceerbare deployment.

llama.cpp · LocalAI · Lemonade · llmfit

AMD Strix Halo Local LLM Guide

Een onafhankelijke open-source setup- en benchmarkgids voor lokale AI, met reproduceerbare benchmarks, ruwe logs, CSV’s, negatieve resultaten en expliciete beperkingen. De evidencekaart omvat 13 systemen of onafhankelijke bronnen en 10 community-benchmarkbijdragers; het project heeft 300+ GitHub-sterren.

Bekijk de guide en meetgegevens

Betrouwbaarheid & observability

Upstream werk aan NVIDIA AICR en OpenTelemetry zorgt dat fouten niet als succes verdwijnen en dat GenAI-telemetrie expliciet en controleerbaar wordt genormaliseerd.

NVIDIA AICR #1730 · OpenTelemetry #49619

Modeldekking & technische documentatie

Een vLLM GGUF-bijdrage legt geteste modelarchitecturen vast. Drie aanvullende doc-merges maken lokale AI-setup en reproduceerbare Strix Halo-benchmarks beter vindbaar en correct uitvoerbaar in externe AI- en homelabprojecten.

vLLM GGUF · Open-source AI · LLM apps · Homelab

LLM-evaluatie in productiecontext

Van mei 2023 tot en met september 2024 uitgevoerd als professioneel contractwerk via Scale AI-platforms. In de praktijk: modelfouten systematisch categoriseren, beoordelingsrubrieken opstellen en hallucinaties herkennen — antwoorden die overtuigend klinken maar feitelijk niet kloppen. Het latere werk aan AI-workflows bestaat uit eigen software-engineering- en open-sourceprojecten.

EvidenceFlow: gecontroleerde AI-output

De gedocumenteerde open-sourcepilot houdt rapportexport tegen totdat een benoemde reviewer goedkeuring geeft. Validatieregels blokkeren uitvoer wanneer verplichte structuur, bronnen of citaten ontbreken; beslissingen worden vastgelegd in een met SHA-256 gekoppeld auditspoor. De repository bevat geautomatiseerde regressietests en instructies om deze controles opnieuw uit te voeren.

Bekijk de repository

Multimodale vision-runtimes

Integratie en kwalificatie van vision-language-modellen (o.a. Qwen2.5-VL en Nemotron Omni) met reproduceerbare image- en OCR-tests, vastgelegde hashes en herhaaltests na herstart. Plus upstream ingediend runtimewerk aan multi-image-verwerking (Ollama) en beeld-/tensorpreprocessing (ONNX Runtime), beide onder review.

Ollama PR #17326

Visionmodellen finetunen

Gerichte LoRA-finetuning voor vision-language-modellen: labels controleren, data scheiden in train-, validatie- en testsets, trainingskeuzes vastleggen en prestaties op ongeziene beelden vergelijken. De nadruk ligt op reproduceerbare verbetering binnen een afgebakende beeldtaak en op het herkennen van grenzen voordat een model in een workflow wordt ingezet.

Beeld-naar-maatvoering

Volledige meetketen — camerakalibratie, distorsiecorrectie, vlak-homografie, pixel-naar-millimeter en foutrapportage — in een synthetische end-to-endtest gevalideerd tegen bekende ground truth: camera-intrinsics binnen 0,16% teruggevonden en een mediane meetfout van 0,08% over twaalf scènes. Dit valideert de implementatie; een fysieke proef met een echte camera is de vastgelegde volgende stap.

Bekijk proef, protocol en resultaten

Goede software-engineering voor AI-systemen begint bij weten wat je test, waarom je kiest en waar de grens ligt.

Software-engineeringmethode

Eerst de grens bepalen.
Dan pas bouwen.

01

Vraag & baseline

We schrijven op wat nog onbekend is, hoe het nu wordt gedaan en welke eenvoudige baseline een nieuw systeem minimaal moet verslaan.

02

Meetprotocol

Representatieve voorbeelden, datakwaliteit, expertlabels, privacygrenzen en foutcategorieën worden vóór de evaluatie vastgelegd.

03

Vergelijken

Modellen, regels en architecturen worden op dezelfde testset vergeleken. Kwaliteit, latency, kosten en uitzonderingen tellen allemaal mee.

04

Onzekerheid

Een betrouwbaar systeem moet weten wanneer het niet genoeg weet. We meten niet alleen correcte antwoorden, maar ook veilige onthouding en escalatie.

05

Reproduceren

Versies, configuratie, testdata, beslissingen en fouten worden traceerbaar vastgelegd, zodat een ander de uitkomst kan controleren.

Eigen AI-infrastructuur

Lokale AI op
eigen hardware.

Kleine Koe beheert een self-hosted AI-platform op een Beelink GTR9 Pro met AMD Ryzen AI MAX+ 395. De omgeving wordt gebruikt voor lokale LLM-inferentie, modelvergelijking, workflowtests en privacygerichte architectuurverkenningen.

Operationeel platform

Linux, Open WebUI en lokale modelservers.

De eigen omgeving combineert beheerde toegang, lokale modelrouting en gecontroleerde externe integraties. Dat biedt directe controle over data, configuratie en deploymentkeuzes.

Vergelijkbare metingen

Modellen vergelijken op dezelfde hardware.

Configuraties, contextlengtes, snelheid, geheugenverbruik en uitvoerkwaliteit worden reproduceerbaar vastgelegd. Daarmee kunnen model- en deploymentkeuzes met meetgegevens worden verdedigd.

Open technische praktijk

De AMD Strix Halo Local LLM Guide wordt aantoonbaar gebruikt.

De onafhankelijke open-source gids heeft 300+ GitHub-sterren. De publieke evidencekaart omvat 13 eigenaarssystemen of onafhankelijke bronnen: 10 beschreven eigenaarssystemen en 3 zelfstandig herleidbare externe bronnen, met 10 community-benchmarkbijdragers. Meerdere resultaten van dezelfde fysieke machine tellen één keer; first-party en communityresultaten blijven gescheiden.

Bekijk de AMD Strix Halo Local LLM Guide

Sterren en bewijsdekking zijn een gedateerde momentopname en publiek controleerbaar in de repository. De genoemde hardware- en softwaremerken onderschrijven Kleine Koe niet.

Verantwoord ontwikkelen

Zorgvuldig ontwikkeld.
Getest voor oplevering.

Architectuur, codebeoordeling, tests en risicoafwegingen blijven de verantwoordelijkheid van de software engineer. We gebruiken AI-assistance bij analyse, implementatie en documentatie. De uiteindelijke wijziging wordt inhoudelijk gecontroleerd en getest vóór oplevering. Externe upstream reviews zijn aanvullend bewijs, geen vervanging voor eigen verantwoordelijkheid.

  • Menselijke eindverantwoordelijkheid
  • Reproduceerbare tests
  • Expliciete onzekerheid
  • Privacy by design
  • Traceerbare beslissingen
  • Geen partnerclaims zonder toestemming

Een technisch vraagstuk dat een goede oplossing verdient?

Breng het proces, de voorbeelden en de gewenste uitkomst mee. We onderzoeken welke software nodig is, hoe die aansluit op je systemen en hoe we de werking kunnen toetsen.