ChatGPT ein AI BOT auf überraschend hohem level?

Die Vermutung der Händler: KI-Firmen beauftragen den massenhaften Bücherkauf, um ihre Programme zu schulen - ohne sich um Urheberrechte und die damit verbundenen Kosten zu scheren.
Zu diesem Ergebnis kommt auch eine Recherche der Washington Post. Die US-Zeitung hatte vor einigen Wochen berichtet, dass Künstliche Intelligenz die im Netz verfügbaren digitalisierten Bücher nahezu komplett erfasst habe. Jetzt sind analoge Inhalte dran.

Wohl deswegen habe das KI-Unternehmen Anthropic sein Programm "Project Panama" lanciert. Dazu gehört ein Scanner, der in Hochgeschwindigkeit einzelne Buchseiten einliest. Diese wurden zuvor aus gebundenen Büchern herausgetrennt. Die Washington Post bezeichnet das lange geheim gehaltene Panama-Projekt als "destructive", also zerstörerisch.
Das ist es in der Tat, wie der Berliner Antiquar Zerfaß erklärt. "Wir hatten erfahren, dass die Bücher nach dem geplanten Digitalisieren geschreddert werden sollen. Da liefert man als Händler natürlich nicht gerne schöne Exemplare, die einen Nimbus oder eine Patina haben."
Er hofft nun darauf, dass Politik und Verbände ebenso alarmiert sind, wie er. Der Börsenverein des Deutschen Buchhandels reagiert auf NDR-Anfrage: "In unseren Augen ist solch eine Trainingspraxis ein klarer Verstoß gegen das Urheberrecht", sagt Börsenverein-Sprecher Thomas Koch. Allerdings gelte das Recht des Landes, in dem die Handlung vorgenommen werde. "Nach deutschem Recht wäre zum Beispiel das Einscannen der Bücher - zu welchem Zweck auch immer - nicht möglich. Dass das jetzt mit antiquarischen Büchern passiert, ist ein weiteres sehr beunruhigendes Beispiel für diese Praxis."
Mit großem Interesse verfolgt der Börsenverein auch die Klage der Penguin Random House Verlagsgruppe gegen Open AI. Die KI des Unternehmens soll das Kinderbuch "Der Kleine Drache Kokosnuss auf dem Mars" exakt kopiert haben - auf Basis eines einfachen Prompts - also des Stellens einer Aufgabe an die KI. Das ist nach deutschem Recht eine klare Urheberrechtsverletzung.
 

"Wir hatten erfahren, dass die Bücher nach dem geplanten Digitalisieren geschreddert werden sollen. Da liefert man als Händler natürlich nicht gerne schöne Exemplare, die einen Nimbus oder eine Patina haben."

puhh.. da kräuseln sich einem die Haare und man ist an "1984", "Fahrenheit 451", "Equilibrium", erinnert..
wobei dort es jedemal mit einem Verbot einhergeht

Ansich finde ich das Scannen ja gut...
in einem Antiquariat verstauben die Bücher, werden eventuell in den nächsten Jahrzehnten von 1-2 Personen überhaupt noch angeschaut oder gar gar nicht mehr...

da ist es ansich gut, wenn DIE MÖGLICHKEIT besteht, das viele Menschen Zugang zu den Informationen haben können..

aber die ganzen Begleitumstände...

1.) Urheberrecht --> gilt das eigentlich bei Büchern noch, die Jahrzehnte oder gar über 100 Jahre alt sind ??

2.) ansich klingt es ja fein, dass das Wissen/Information mehreren Leuten zur verfügung gestellt werden kann...
ABER: das wie..
eine Firma (OpenAI, Anthropic, Amazon, Google, Meta) kauft die Bücher und Scannt sie..
Urheberrecht hin oder her: das was sie gescannt haben, liegt auf ihren Servern ("gehört ihnen"), haben sie die Macht der Berechtigung...
wenn sie entscheiden, dass sie die Scanns löschen wollen -> dann machen sie das einfach
wenn sie den Zugang von heute auf morgen einschränken -> dann manchen sie das einfach
wenn sie Informationen in den Büchern ändern würden --> man könnte es nicht mehr nachprüfen
etc. etc.

als "Sahnehäupchen" dann die Zerstörung der Originale

sie stehlen also nicht nur die Informationen/Geschichten um sie zu duplizieren - sie vernichten die Orignale und haben so alleinigen Zugriff auf die Daten..
das ist ja noch viel schlimmer als eine "bloße" Raubkopie
 
ansihc verständlich..
bei uns werden im Haus jeden Sommer 2-3 Ferialpraktikanten angestellt, die dann 1-2 Monate lang Dokumente scannen, welche seit Jahren im Keller schlummern --> und dann kommt "Reißwolf", eine Firma die, die Papier-Originale dann schreddert und prof. entsorgt, mit Zertifkat etc..

beim Stickwort "Antiquariat" kommt dann aber die Emmotion mit ins Spiel und da wirds dann gruselig das zu lesen
 
Hat jemand schon mit Fabel5 gearbeitet ? (dem Nachfolge-Modell von Opus bei Anthropic)
ich hab jetzt ein paar Tage Access wie es scheint..
und - joh - nochmal ein deutlicher Sprung

ich hab vor paar Wochen ein paar Programmier-Projekte privat für mich gestartet...

und bei einem hab ich seit 3-4 Wochen (ich tu ja nur alle paar Tage mal was) einen Fehler den ich nicht und nicht wegbekommen habe...

Sonnet und Opus 4.8 haben mir natürlich immer wieder eine Ursache für die Fehler genannt, den Code entsprechend angepasst und 2h später hängte sich das Programm wieder auf..
natürlich wurde dann - sehr selbstbewusst wie die KIs ja nunmal sind - gleich der Grund dafür gefunden.. ."aber jetzt.. jetzt haben wir ihn"...
nur um dann wieder was am Programm zu ändern ohne das Fehler dann doch behoben wäre...

gestern mit Fabel5 es nun probiert.. den bestehenden Memory lesen lassen und dann mal machen lassen..
auch hier sehr selbstbewusst ein FEhler gefunden.. aber ganz was anderes, und gleich die Beweiskette geführt warum zuvor die Antworten der Modelle in die falsche Richtung gingen..

DAnn hat es gleich noch vorhergesagt wann das Programm das nächste mal abstürzen wird (zur Kontrolle, 3 Uhr früh) und dass es dan die entsprechende Maßnahmen setzen wird... und ich ihn der Früh dann das kontrollieren soll..
und siehe da.. in der Früh musste ich - Sicherheitssettings von mir -noch 2-3 Befehle das OK geben, dass er es machen darf..

und: jetzt läuft das Programm endlich, was Sonnet, Chatgpt und Opus 3-4 Wochen lang nicht geschafft haben..

und im Prinzip hab ich nix gemacht, nur gesagt, sowas wie: "Schau dir an, was bis jetzt schief ging, was bis jetzt gemacht wurde, überprüfe und korrigiere".

kann natürlich alles nur Zufall sein, die anderen Modelle hatten sich in eine Schiene verrannt, und kamen da nimma raus, haben einen Fehler angenommen wo eigentlich gar keiner war und sind von diesem Punkt immer wieder gestartet und haben dann verschiedene Dinge probiert die alle nicht gefruchtet haben, weil die Grundannahme schon falsch war

das war jetzt meine erste Erfahrung mit Fabel5 - und es fühlte sich mächtig an...
naja.. habs nur paar Tage, wohl als Appetitmacher - dann verschwindets wieder aus meinem Abo...
werd es also noch auf 2-3 andere Probleme ansetzen bei anderen Progs...
 
Nö, aber, dass sich die Modelle immer mal rettungslos verhaken, kann ich auch aus meinem Anwendungsbereich bestätigen (Prozessmodellierung: Geschäftsprozesse / IT-Dienste / Compliance).

Meine These lautet, dass hierbei die weit überwiegende Quellenlage genutzt und die statistisch irrelevanten Abweichungen nicht berücksichtigt werden, demnach tatsächlich die Prämisse, die die maschinellen Verarbeitung vom Prompt ableitet, und damit das Ergebnis falsch ist. Spannend: Wenn ich versuche das mit Randbedingungen im Prompt zu korrigieren, geht es meistens schief. Wenn ich "Falsch!" prompte, wird in 8 von 10 Fällen ohne weitere Ausführungen im Prompt die Abweichung berücksichtigt.

Die Anzahl der Fälle war bisher aber so gering, dass es sich nicht wirklich um belastbare Ergebnisse handelt.

Die Herausforderung:
Bei deiner Aufgabenstellung erfolgt die empirische Überprüfung durch das Merkmal "Programm hängt sich auf" (bestenfalls).
Bei meiner Aufgabenstellung muss ich wissen, oder zumindest erahnen, dass da was nicht stimmt, weil die Inhalte der angegebenen Quellen in Bezug auf die Prämisse nicht falsch sind, nur in Bezug auf die Abweichung.
 
Die Herausforderung:
Bei deiner Aufgabenstellung erfolgt die empirische Überprüfung durch das Merkmal "Programm hängt sich auf" (bestenfalls).
Bei meiner Aufgabenstellung muss ich wissen, oder zumindest erahnen, dass da was nicht stimmt, weil die Inhalte der angegebenen Quellen in Bezug auf die Prämisse nicht falsch sind, nur in Bezug auf die Abweichung.
jo, man sagt ja auch: wenn ein (ex)-Mitarbeiter seiner Firma schaden will,
dann löscht er keine Daten (das wird schnell bemerkt, und kann per Backup zurückgespielt), sondern er ändert sie
 
puhh.. da kräuseln sich einem die Haare und man ist an "1984", "Fahrenheit 451", "Equilibrium", erinnert..
wobei dort es jedemal mit einem Verbot einhergeht

Ich finde das fast noch schlimmer. Bei einer derartigen Vermögenskonzentration kommt das ja faktisch mit einem Verbot einher, nur, dass man im Gegensatz zu vielen Romanvorlagen, kein Mindestmaß an gesellschaftlicher Legitimation dafür hat, sondern die Akteure nach Gutdünken entscheiden. Die einzige Legitimation besteht im Schutz von Eigentum und Durchsetzen desselben. Das finde ich viel gruseliger.
 
The new model, called Muse Image, rolled out with deep integrations woven into the Instagram app. As part of this update, public Instagram profiles are now automatically opted into being fodder for generative AI remixes. All someone has to do is tag your account’s profile in a prompt—if it’s public—and they can use Meta AI to generate an image using your likeness.
 
Noch im Juli will die Europäische Kommission eine Verordnung auf den Weg bringen, die elektronische Energielabels für sämtliche Rechenzentren in der EU vorschreibt.
Neue wie bestehende Anlagen mit einer IT-Leistung ab 500 Kilowatt müssten dann ihren Energie- und Wasserverbrauch offenlegen – so steht es in einem Bloomberg vorliegenden Entwurf.

Wie dringend das Thema ist, zeigt Google: In seinem aktuellen Nachhaltigkeitsbericht meldete der Konzern einen Stromverbrauch von rund 43,6 Millionen Megawattstunden für 2025. Das entspricht ungefähr dem Jahresstromverbrauch Griechenlands.
Der Strombedarf der Branche dürfte sich nach der Prognose der Kommission gegenüber 2023 mehr als verdoppeln und bis 2030 über 3 Prozent des gesamten EU-Stromverbrauchs übersteigen.
 
Wie dringend das Thema ist, zeigt Google: In seinem aktuellen Nachhaltigkeitsbericht meldete der Konzern einen Stromverbrauch von rund 43,6 Millionen Megawattstunden für 2025. Das entspricht ungefähr dem Jahresstromverbrauch Griechenlands.

das klingt ja mal nach mega viel..
aber was muss man sich darunter vorstellen?

Google deckt die Suchabfragen von 4-5 Milliarden Menschen ab (also 4-5 Milliarden Menschen nutzen regelmässig die Google-Suche)
dazu kommt die Google Navigation (GPS) die viele nutze,
3 von 4 Smartphones nutzen Android und somit auch Google Dienste
dann kommen die ganzen Cloud-Dienste hinzu, die von Firmen genutzt werden
etc. etc.

Stromverbrauch von Griechenland klingt enorm...

OpenAIs KI meint,
dass das ca. ein 2900stel des Primärenergiebedarfs der Welt ist,
bzw. ein 550stel des Strombedarfs der Welt

also 0,18% des Welt-Strombedarfs geht für die Google-Dienste für knapp 5Mrd. User drauf..

die 56.500 GWh/Jahr Strombedarf Griechenlands auf 5 Milliarden Personen umgerechnet:

diesen Strombedarf auf 5 Milliarden Nutzer runtergerechnet wären dann 11 kWh pro Jahr und Person,
oder: 30 Wh pro Tag
(oder 60 Meter am Tag mit einem Benziner fahren)

(also das was ein Fernseher heute so in 20-30min verbraucht)
 
Zuletzt bearbeitet:
One of the most horrific cases of allegedly Grok-generated child sex images was shared in a proposed class action lawsuit that was expanded Tuesday. Now, young girls not only accuse X and xAI of building toxic AI “nudify” tools but also of shielding child predators by obstructing police investigations into Grok-generated child sex abuse materials (CSAM).
Grok allowed the man to generate extreme images depicting incest and rape without flagging any harmful behavior, the complaint said. Seemingly, xAI’s child safety system only intervened after the man input a prompt for “gang rape.” That request sent a CyberTip to the National Center for Missing and Exploited Children (NCMEC), which alerted law enforcement to the AI CSAM.

Yet the harm was not stopped then, either. Despite mandatory reporting requirements to share information like a user’s IP address when CSAM is flagged, xAI repeatedly refused to help cops or NCMEC identify the user, the complaint alleged. For weeks, xAI allegedly “obstructed this investigation at every turn” and made it harder for “law enforcement efforts to locate, identify, and apprehend the perpetrator.”
In addition to adding more victims to the complaint, lawyers also added Stability AI as a defendant.

According to the amended complaint, Stability AI’s open-weight models were trained on CSAM and allegedly “serve as the basis for third-party ‘nudify’ apps,” which Grok users supposedly rely on to further alter explicit Grok outputs.

Like X and xAI, Stability AI is accused of deliberately relaxing safeguards to seize a market by allowing generations of not-safe-for-work (NSFW) content. The lawsuit alleged that “on information and belief,” prior safeguards preventing NSFW outputs were removed after Stability AI’s model usage declined due to user complaints that the model got too prude.
That report did not call out X or xAI, but it did suggest that it’s likely common for AI firms to avoid sharing information on AI CSAM that cops can use to make arrests. For another example, NCMEC noted that Amazon AI services submitted the vast majority of tips (1.1 million), and none of those tips gave “actionable information” that law enforcement could use to identify perpetrators.

Der verlinkte Artikel zu Stability AI:
More than 1,000 known child sexual abuse materials (CSAM) were found in a large open dataset—known as LAION-5B—that was used to train popular text-to-image generators such as Stable Diffusion, Stanford Internet Observatory (SIO) researcher David Thiel revealed on Wednesday.

SIO’s report seems to confirm rumors swirling on the Internet since 2022 that LAION-5B included illegal images, Bloomberg reported. In an email to Ars, Thiel warned that “the inclusion of child abuse material in AI model training data teaches tools to associate children in illicit sexual activity and uses known child abuse images to generate new, potentially realistic child abuse content.”
“Our new investigation reveals that these models are trained directly on CSAM present in a public dataset of billions of images, known as LAION-5B,” Thiel’s report said. “The dataset included known CSAM scraped from a wide array of sources, including mainstream social media websites”—like Reddit, X, WordPress, and Blogspot—as well as “popular adult video sites”—like XHamster and XVideos.
 
du schmeißt immer nur Aritkelstellen hier rein, ohne ein eigenes Kommentar jeglicher Art
Marc schmeißt die hier mit (hoffentlich repräsentativ) ausgewählten Textstellen rein. Ich finde das sehr hilfreich, um zu entscheiden, ob ich den Artikel lesen möchte oder nicht.

Um Klassen besser als (wie bei vielen YouTube-Videos) nur den unkommentierten Link einzustellen.
 
Zuletzt bearbeitet:
@Marc
das Thema scheint dich ja sehr zu interessieren, soviele Artikel wie du zu dem Thema liest..
Meist sind das nur AI-Artikel auf "meinen" täglichen Nachrichtenseiten über die ich stolper und in der Regel nur kurz überfliege.

aber hast du gar nix dazu zu sagen?
du schmeißt immer nur Aritkelstellen hier rein, ohne ein eigenes Kommentar jeglicher Art
In der Gesamtheit sind das Artikel, die meine persönliche Kritik an LLMs der handvoll großer AI-Firmen, wie die industrieweiten Urheberrechtsverletzungen als Geschäftsmodell, "Ringfinanzierung" der beteiligten Firmen ohne volkswirtschaftlich erkennbaren Nutzen, ausufernder Wasser- und Energieverbrauch, etz, unterstreichen oder belegen.

Die Erstellung von Kinderpornographie durch LLMs bei gleichzeitiger Behinderung der Justiz durch die LLM-Betreiber ist IMO nur ein besonders widerwärtiger Teilaspekt der Branche.

Bitte nicht missverstehen, der Einsatz von LLMs zur Analyse von Problemstellungen in Forschung, Medizin, Technik, etz finde ich phantastisch!
 
Zuletzt bearbeitet:
hast du alle gelesen ?
Nein, lediglich die bei denen mir Marc Auszüge nicht ausreichten oder den Wunsch nach mehr weckten. Zum Beispiel bei dem ersten Artikel um den Stiefvater, wollte ich etwas mehr Erfahren. Nicht nur, dass er sich selber das Leben nahm. Nein, auch das Mädchen muss jetzt diese Last mit sich herumschleppen. Das ganze weil Grok nicht nur alle Warnmeldungen ignorierte, sondern auch lieber die Ermittelungen blockierte.
a girl’s stepfather took his own life after cops discovered that he had used Grok to create 7,000 sexually explicit images using one photo taken when his stepdaughter was 11 years old,
7000 Bilder generieren sich nicht mal eben, davon ab das solche Bilder (unabhängig vom Alter der Person) nicht erstellt werden sollten. Wenn der Algorithmus nicht auf Geld scheffeln ausgelegt wäre, sondern bereits beim ersten Bild die entsprechenden Stellen ordnungsgemäß und vollständig informiert hätte, dann hätte die ganze Tragödie vielleicht abgewendet werden können (ich weiß, Spekulatis gibt es noch nicht).

Aber alle die gerne und viel Texte und Bilder per LLMs erzeugen: ich solltet euch dann überlegen, auf Datenbasis die LLM trainiert wurde. Bei Texten, wurde 'Mein Kampf' oder die 'Protokolle der Weisen von Zion' oder 'Das Kapital' verwendet? Oder bei Bildern, welche Bilder oder Videos wurden zum Training benutzt...

Ich sehe Potential für LLMs, aber ich sehe auch einen riesigen Haufen ungelöster Probleme. Dabei sind die Urheberrechtsprobleme noch das kleinste Problem, die mangelnde Kontrolle weiß alles eingeflossen ist und mit welcher Gewichtung macht mir mehr Sorgen, genauso wie die Tatsache, dass die ganzen Eingaben (in der Regel) ebenfalls auf den Server landen und dort weiterverarbeitet werden können (und wie das obige Beispiel zeigt, nicht zu Vorteil der Gesellschaft).

Ich bin mir ziemlich sicher, dass Joseph Weizenbaum nicht amüsiert wäre über die Entwicklung (auch wenn er gewisse Ansätze bereits bei Eliza sehen hatte).
 
das klingt ja mal nach mega viel..

Dieser Satz aus dem Ars Technica Artikel ist nicht ganz unwichtig:
The unprecedented 37 percent annual increase is part of an ongoing trend, given how Google’s total electricity consumption also grew by 27 percent in 2024.

Ich hab mal die Google KI gefragt, was 37% Steigerung pro Jahr in 10 Jahren ist. Sie hat in der "Übersicht mit KI" erst 26,1-fach behauptet, beim Nachfragen und Springen in den "KI Modus" was von 22,77-fach erzählt, um mir dann zu bestätigen, dass 1,37^10 in Wahrheit 23,29 ist. Da braucht es also noch etwas mehr Rechenleistung, damit die Google KI nicht regelmäßig mit voller Überzeugung Unsinn und Lügen fabriziert.

1/550 * 23,29 sind schon 1/24 oder 4,2% vom weltweiten Strombedarf. Jetzt noch die anderen KI Buden mit dazu rechnen ... Wie lange dauert es bis KI 10% des weltweiten Stroms in heiße Luft umwandelt? Klingt mega übertrieben ...

Ich hab keine Ahnung, wie sich der Strombedarf tatsächlich entwickeln wird, aber 37% Zuwachs in einem Jahr, 74% in zwei Jahren ist nicht wenig. Rechenzentren und Halbleiterherstellung wird man vermutlich nicht so einfach exponentiell skalieren können. Aber momentan ist alles auf maximal mögliches Wachstum ausgerichtet. Wer Rechenzentren mit Gasturbinen betreibt, der hat auch sonst keine Skrupel.
 
Zurück
Oben Unten