Strategie

Van fleet learning tot computer vision: 5 manieren waarop AI-robots distributiecentra volledig veranderen

Albert Heijn gebruikt een slimme schoonmaakrobot in een AH supermarkt in Rotterdam.
Albert Heijn gebruikt een slimme schoonmaakrobot in een AH supermarkt in Rotterdam.ANP / Peter Hilz
Leestijd 5 minuten

Winkelen is een complexe uitdaging voor AI-gestuurde robots. Je staat er niet direct bij stil wanneer je in de supermarkt gedachteloos je zakje sla of sixpack bier in je winkelwagen plaatst. Maar voor een robot was dat lange tijd een onmogelijke opgave. Je moet daarvoor immers niet alleen tienduizenden producten herkennen, maar ze óók nog in je mandje leggen.

Een zakje sla moet je héél voorzichtig oppakken en er mag zeker geen sixpack bier op staan.

„Bovendien moet een robot kunnen omgaan met heel veel onverwachte uitzonderingen’’, licht James Humphreys toe. De VP Engineering van retailtechreus Ocado was aanwezig tijdens de AI World Summit in Amsterdam.

Humphreys is nauw betrokken bij de ontwikkeling van Ocado’s Storage and Retrieval System (OSRS). Het AI-gestuurde orderpickingsysteem selecteert en verpakt boodschappen voor dertien internationale partners, waaronder Ahold, en won recent een reeks prestigieuze retailprijzen, waaronder de Best Use of Robotics Award (2025).

„Onze robots moeten bijvoorbeeld ook kunnen omgaan met gescheurde verpakkingen, gevallen producten kunnen oprapen en eventueel ook het ordermandje herschikken om ervoor te zorgen dat alles past’’, zegt Humphreys. „Al die verschillende acties vereisen heel veel robotdenkkracht.’’

Humphreys en zijn medewerkers werkten enkele jaren aan Ocado’s On-Grid Robotic Pick-systeem. Dat is een complex samenspel van geavanceerde technologische oplossingen en materialen. De volgende technologieën maken complexe robotinzet op de werkvloer momenteel mogelijk in de modernste Europese distributiecentra.

Computer vision: de zoektocht naar het optimale grijppunt

Voordat een robotarm iets kan pakken, moet die het product herkennen en de ideale positie in de orderbak bepalen. Het licht en de positie van de opgeslagen producten verschillen voortdurend en de al verzamelde artikelen in de orderbak liggen telkens anders, bedekken elkaar en weerkaatsen of vervormen het licht met hun verpakkingen.

Het moeilijkst is het bepalen van het optimale grijppunt: de plek waar de arm kan aangrijpen zonder het product te beschadigen en zonder dat het losraakt. Bij een net uien of een doos met loszittende folie is het een inschatting die per exemplaar verschilt. Ocado claimt een herkenningsnauwkeurigheid van vrijwel honderd procent.

Lees ook: De hypermoderne warehouses van bol, PostNL en Albert Heijn draaien bijna volledig op robots en AI

Deep reinforcement learning: leren door te doen

Om een product op de juiste wijze te kunnen verplaatsen, moet het systeem eerst de eigenschappen leren kennen. De gemiddelde supermarktketen heeft echter tienduizenden producten, oftewel stock keeping units (SKU’s), op voorraad. Daar komen wekelijks producten bij. Hoe leert het systeem daarmee omgaan?

In plaats van nieuwe instructies voor elk afzonderlijk product te schrijven, leert het systeem door te doen. Het probeert een greep, registreert of die slaagt, en past de volgende poging aan. Een geslaagde greep versterkt het gedrag en een mislukte greep zwakt het af. Zo leert het systeem een net uien anders vast te pakken dan een pak melk, zonder dat een mens die regels ooit opschreef.

Het lastige zit in de fysieke wereld. Waar een algoritme een spel miljoenen keren in simulatie speelt, moet een robotarm deels in het echt oefenen, met producten die kapotgaan en tijd die verstrijkt. Toch is dat nog altijd een stuk goedkoper dan telkens opnieuw instructies schrijven.

Behavioral cloning: volg het goede voorbeeld

Sommige artikelen zijn te lastig of bewerkelijk om al doende te leren: een tros druiven, een zak die scheurt of een fles die je onder een precieze hoek moet kantelen. Voor die gevallen laat Ocado het systeem niet eindeloos zelf oefenen, maar afkijken bij wie het al kan: de mens.

Bij behavioral cloning bestudeert het systeem hoe een menselijke picker, uitgerust met sensoren en camera’s, een moeilijk artikel vastpakt en bootst het dat gedrag na. De demonstratie wordt trainingsdata.

Waar reinforcement learning met vallen en opstaan een strategie opbouwt, krijgt het systeem hier een voorbeeld cadeau en hoeft het dat alleen nog te reproduceren. Het is de snelste route naar de moeilijkste grepen. Saillant detail: de picker die voordoet hoe het moet, traint daarmee zijn eigen vervanger en maakt zichzelf dus mogelijk overbodig.

Fleet learning: samen leer je meer

Een menselijke picker die een handige greep of stapeltechniek ontdekt, houdt die kennis in zijn eigen hoofd. Collega’s die even verderop precies hetzelfde werk doen, hebben daar meestal niets aan. Bij robots ligt dat anders.

Als één robotarm heeft ontdekt hoe je een lastig verpakt product het beste kunt vastpakken, ligt die kennis direct vast in het aansturende systeem. Dat betekent dat álle robotarmen direct over die kennis beschikken. In hetzelfde magazijn en desgewenst ook op alle andere locaties die met hetzelfde systeem werken.

Niet één robot werkt dus efficiënter, maar de hele vloot tegelijk. Een cruciaal schaalvoordeel: bij Ocado voedt elke greep op elke locatie immers hetzelfde systeem. Hoe meer armen actief zijn, hoe sneller ze allemaal leren, en hoe groter de voorsprong op wie later begint.

Het is het klassieke netwerkeffect, toegepast op fysieke handelingen. Hier is data geen bijproduct van het werk, maar een product op zich dat sterk bijdraagt aan het concurrentievermogen van Ocado. Bovendien kan Ocado dit soort inzichten ook onder licentie gaan verhuren aan kleinere organisaties.

Lees ook: Trump verbiedt Chinese robots, maar experts waarschuwen: ‘Dit maakt China alleen maar sterker’

Diffusiemodellen: helderheid creëren vanuit ruis

De vier voorgaande technologieën draaien in Ocado’s magazijnen. Met de vijfde technologie kijkt de retailtechspecialist vooruit. Zogenoemde ‘diffusiemodellen’ zijn het type AI dat bijvoorbeeld ook beeldgeneratoren als Midjourney en DALL·E gebruiken.

Kort door de bocht creëert een diffusiemodel beelden door eerst ruis aan een afbeelding toe te voegen en vervolgens te leren hoe het die ruis stap voor stap kan verwijderen (‘denoisen’) om een scherp beeld te vormen.

Ocado en andere robotontwikkelaars passen datzelfde principe nu toe om bewegingen van robots te ‘reconstrueren’. Zo kan een systeem op basis van data die in kleine stukjes is opgeknipt, uit één complexe handeling leren hoe het onbekende nieuwe handelingen het beste kan uitvoeren.

1 van 5
Technologie 1: Computer Vision Beeld gegenereerd met Google Gemini
Technologie 1: Computer VisionBeeld gegenereerd met Google Gemini
Technologie 2: Reinforcement Learning Beeld gegenereerd met Google Gemini
Technologie 2: Reinforcement LearningBeeld gegenereerd met Google Gemini
Technologie 3: Behavioral Cloning Beeld gegenereerd met Google Gemini
Technologie 3: Behavioral CloningBeeld gegenereerd met Google Gemini
Technologie 4: Fleet Learning Beeld gegenereerd met Google Gemini
Technologie 4: Fleet LearningBeeld gegenereerd met Google Gemini
Technologie 5: Difussiemodellen Beeld gegenereerd met Google Gemini
Technologie 5: DifussiemodellenBeeld gegenereerd met Google Gemini

Dark warehouses in Nederland

Hoeveel menselijke handelingen zijn nog nodig in Nederlandse magazijnen, en hoe veranderen robots en slimme AI-algoritmes de manier waarop onze pakketjes en boodschappen worden bezorgd? In deze aflevering van Revolutie Robotica nemen we een kijkje in de gigantische magazijnen van bol, PostNL en Albert Heijn.

Ontvang elke week het beste van BusinessWise in je mailbox. Schrijf je hier nu gratis in:

Delen: