Bilderkennung: Computer beschreibt Bild

Was ist auf einem Bild zu sehen? Zwei Entwicklerteams in den USA haben Verfahren entwickelt, um Bilder automatisch zu erkennen und zu beschreiben. Das ist nützlich für die Bildersuche, kann aber auch ganze andere Auswirkungen haben.

Artikel veröffentlicht am ,
Bilder mit Beschreibung: Manchmal kommt es auf die Worte an.
Bilder mit Beschreibung: Manchmal kommt es auf die Worte an. (Bild: Google)

Googles Bildersuche achtet eher auf Texte neben Bildern als auf die Bilder selbst. Das soll sich ändern: Zwei Entwicklerteams haben Lösungen gefunden, mit denen Computer Bilder erkennen und sie beschreiben können.

  • Funktionsweise des Google-Systems (Bild: Google)
Funktionsweise des Google-Systems (Bild: Google)

Eines der Teams ist von Google, das andere von der Stanford-Universität in Kalifornien. Beide haben einen ähnlichen Ansatz gewählt: Sie kombinieren Verfahren aus der Bildverarbeitung und der Verarbeitung der natürlichen Sprache.

Software imitiert Gehirn

Beide Gruppen setzen dabei auf neuronale Netze. Künstliche neuronale Netze (KNN) sind Computerprogramme, die von der Funktionsweise des menschlichen Gehirns inspiriert sind. Sie können lernen, Muster zu erkennen. Jeder Ansatz verknüpft zwei dieser neuronalen Netze.

Die Google-Entwickler nehmen ein Convolutional Neural Network (CNN), das darauf trainiert wurde, Objekte auf Bildern zu erkennen. Das CNN analysiert ein Bild und leitet das Ergebnis an ein rückgekoppeltes oder rekurrentes neuronales Netz (RNN) weiter. Das erstellt eine Beschreibung des Bildes. Das Konzept der Stanford-Gruppe ist damit vergleichbar.

Computer lernen Bilder erkennen

Die Forscher haben ihre Systeme zunächst angelernt. Dazu haben sie sie jeweils mit einer relativ kleinen Menge an Bildern gefüttert, die mit einer Beschreibung versehen waren. Die Algorithmen lernten, Muster auf Bildern und in Beschreibungen zu erkennen. Dann wurden sie auf größere, öffentlich zugängliche Datenbestände, darunter Flickr8K und Flickr30K, angesetzt.

Die Systeme liefern einfache Bildunterschriften wie "Schwarz-weißer Hund springt über ein Hindernis" oder "Eine Gruppe junger Leute spielt Frisbee". Das mag nicht sehr kreativ sein, reicht aber als Beschreibung durchaus.

Bilder werden automatisch und genau in Worte übersetzt

"Ein Bild mag mehr sagen als tausend Worte", schreiben Oriol Vinyals, Alexander Toshev, Samy Bengio und Dumitru Erhan im Google Research Blog. "Aber manchmal sind die Wörter das Nützlichste. Deshalb ist es wichtig, dass wir Möglichkeiten finden, um Bilder automatisch und genau in Worte zu übersetzen."

Die neuen Algorithmen können dafür genutzt werden, Millionen von Bildern und Videos im Internet zu beschreiben und damit auffindbar zu machen. Außerdem könnten sie beispielsweise Sehbehinderten oder Robotern bei der Navigation helfen. Sie könnten aber auch für die Überwachung eingesetzt werden, warnt die New York Times: Überwachungskameras könnten dann nicht nur Gesichter, sondern auch Verhaltensweisen erkennen.

Bitte aktivieren Sie Javascript.
Oder nutzen Sie das Golem-pur-Angebot
und lesen Golem.de
  • ohne Werbung
  • mit ausgeschaltetem Javascript
  • mit RSS-Volltext-Feed


Aktuell auf der Startseite von Golem.de
Rebel Moon - Teil 2
Sternenkrieg um einen Bauernhof

Rebel Moon: Teil 2 trägt den Untertitel Die Narbenmacherin, hat in unserer Erinnerung aber keinerlei Spuren hinterlassen.
Eine Rezension von Daniel Pook

Rebel Moon - Teil 2: Sternenkrieg um einen Bauernhof
Artikel
  1. Fehlerhaftes Pedal: Tesla muss Cybertruck zurückrufen
    Fehlerhaftes Pedal
    Tesla muss Cybertruck zurückrufen

    Tesla hat beim Cybertruck einen erheblichen Rückschlag erlitten. Das Unternehmen hat eine Rückrufaktion für fast alle 3.878 Cybertrucks gestartet.

  2. Delta im Alt Store: Endlich lässt sich Zelda auf dem iPhone spielen - per Umweg
    Delta im Alt Store
    Endlich lässt sich Zelda auf dem iPhone spielen - per Umweg

    Emulatoren für Retrogames waren auf iOS lange nicht erwünscht. Nun lassen sich erstmals ROMs mit Apples Erlaubnis auf das iPhone laden.
    Ein Hands-on von Daniel Ziegener

  3. Voodoo-X: Bastler bauen eine neue 3dfx Grafikkarte
    Voodoo-X
    Bastler bauen eine neue 3dfx Grafikkarte

    Mit originalen Chips und neuen Designtools soll die bisher beste 3dfx-Grafikkarte entstehen. HDMI und zuschaltbaren Speicher gab es bisher nicht.

Du willst dich mit Golem.de beruflich verändern oder weiterbilden?
Zum Stellenmarkt
Zur Akademie
Zum Coaching
  • Schnäppchen, Rabatte und Top-Angebote
    Die besten Deals des Tages
    • Daily Deals • Spring Sale bei Gamesplanet • Neuer MediaMarkt-Flyer • MindStar: AMD Ryzen 7 7800X3D 339€ • Bose Soundbar günstig wie nie • Samsung Galaxy S23 -37% • MSI OLED Curved 34" UWQHD 175Hz -500€ • Alternate: Deep Cool CH560 Digital Tower-Gehäuse 99,90€ • PS5-Spiele -75% [Werbung]
    •  /