• @scorpionix@feddit.de
    link
    fedilink
    Deutsch
    168 months ago

    Na, das kann ja nur gut gehen. Freue mich auf Perlen wie: “Hier ist das Zweite Deutsche Fernsehen UND ER LECKE MICH IM ARSCHE!” /s

    • @geissi@feddit.de
      link
      fedilink
      Deutsch
      208 months ago

      UND ER LECKE MICH IM ARSCHE

      Also mehr klassische deutsche Literatur kann doch nur gut sein.

    • @Pantoffel@feddit.de
      link
      fedilink
      Deutsch
      58 months ago

      Da wird es bestimmt einige witzige Vergebärdensprecher geben 😄 Ich finde das allerdings nicht so dramatisch, wenn es meistens gut funktioniert und wir somit alle wichtigen (oder mehr) Sendungen übersetzen.

      • federalreverse-old
        link
        fedilink
        Deutsch
        11
        edit-2
        8 months ago

        Die automatischen Übersetzungen auf YouTube empfinde ich manchmal als extrem ablenkend. Angewiesen möchte ich darauf nicht sein.

      • @scorpionix@feddit.de
        link
        fedilink
        Deutsch
        58 months ago

        Ich sehe es tatsächlich auch erstmal positiv, aber bei dem aktuellen Stand der KI, wird es leider unvermeidlich zu solchen Patzern kommen. Wobei natürlich auch der beste menschliche Dolmetscher sich mal verspricht.

        • @Pantoffel@feddit.de
          link
          fedilink
          Deutsch
          28 months ago

          Welche Aufgaben muss die KI denn überhaupt lösen:

          • Speech to Text
          • Text to Sign language oder beides auf einmal. Allerdings bezweifle ich, dass es dafür gute Modelle gibt.

          Klar, für ersteres muss eine gute KI genommen werden. Open Source kenne ich da nichts gutes. Und nein, KALI ist nicht gut, es ist scheiße im Vergleich zum Stand der Technik. OpenAI Whisper finde ich extrem gut, allerdings datenschutztechnisch schlecht. Wenn die da etwas gutes finden, was auch mit Deutsch funktioniert, dann… Aber ja, daran wird es haken.

          Zweiteres, Text to Handsprache, da sehe ich überhaupt kein Problem. Das können, ich kenne mich mit Handsprache nicht sonderlich gut aus, Bilder seien, die aneinander gereiht sind und zwischen denen interpoliert wird.

          • @cron@feddit.de
            link
            fedilink
            Deutsch
            68 months ago

            Gebärdensprache ist mehr als die Aneinanderreihung von Gesten, die 1:1 dem Satz entsprechen. Denn einerseits hat Gebärdensprache einen anderen Satzbau und Grammatik, andererseits können Gebärden auch eine “Betonung” haben.

            Das wär alles sicher machbar, bräuchte aber sicher viel Training für die KI.

          • Turun
            link
            fedilink
            Deutsch
            48 months ago

            Das können, ich kenne mich mit Handsprache nicht sonderlich gut aus, Bilder seien, die aneinander gereiht sind und zwischen denen interpoliert wird.

            Ich glaube das ist um einiges komplizierter. So weit ich weiß: Zum Beispiel werden Richtungen einfach durch eine Handbewegung in die entsprechende Richtung gezeigt. Was start one Ziel dieser Bewegung ist hängt dann vom Kontext ab. Klar, LLMs verstehen inzwischen worauf sich ein “es” im Satz bezieht, aber nichtsdestotrotz ist das ein richtig richtig schweres Problem für Computer.

            Der Wikipedia Artikel ist interessant: https://de.wikipedia.org/wiki/Gebärdensprache

            Die Gebärden werden phonologisch in vier Parameter zerlegt, die phonemisch weiter analysiert werden: in Handkonfiguration, Handorientierung, Bewegungsausführung und Ort der Bewegung. Viele Gebärden sind stark flektiert. Informationen können pronominal (durch verschiedene sichtbare Formen) in einer einzigen Gebärde eingebaut werden, z. B. in DGS die Verbgebärde, glossiert mit ICH-BUCH-GEBEN-DIR-SCHNELL[5] schließt die Bewegungsrichtung von „ich“ nach „du“, und zwar schnell, ein und die Handkonfiguration zeigt das Halten eines imaginären Buches an. Wenn abgewandelt in der Bewegung von „du“ nach „ich“, ergibt DU-BUCH-GEBEN-MIR-SCHNELL. Die Gebärde kann mit anderen Handformen modifiziert werden, um anzuzeigen, was gegeben wird, z. B. ein dickes oder dünnes Buch, eine Flasche, ein Fuß- oder Golfball, ein Stück Papier, einen Stapel Bücher usw. Dazu kommt noch die unterschiedliche Orientierung der Hand bzw. Hände, ob das Objekt horizontal oder vertikal übergeben wird. Insgesamt sieben Bedeutungsteile können in dieser einzigen Gebärde erkannt werden: Subjekt, Empfänger (Einzahl oder Mehrzahl), dessen Lokalität (links, rechts, nahe oder fern), Objekt, Größe bzw. Menge des Objekts, verbiales Adverb, einmal oder wiederholt.

  • @taladar@feddit.de
    link
    fedilink
    Deutsch
    118 months ago

    Wie wäre es denn mit einem Kompromiss, Automatik bei Live-Sendungen, Automatik mit Editor der das noch mal Probe liest bei allem was nicht live ist? Sollte immer noch reichlich Zeit und Kosten sparen.

  • @BurnoutDV@feddit.de
    link
    fedilink
    Deutsch
    2
    edit-2
    8 months ago

    Oh, das jetzt aber gar nicht einmal so gut.

    Wo trainiere ich dann bitte meine speech to text modelle? Also nicht ich sondern openai bspw…

    Wenn man Stille in einer Aufnahme hat und whisper rüber jagt hat man oft copyright Angaben von öffis, die Existenz dieser Artefakte weißt darauf hin das ein größerer teil der Daten aus diesen Quellen stammt.

    https://github.com/openai/whisper/discussions/928

    Ironisch wie der Einsatz von “ki” trainingsdaten vergiftet. Das fühlt sich ein wenig an wie der stahl aus schiffen vor den Atombombentest: pre-AI-Data .

    Oder kurzum, besser als jetzt werden die Trainingsdaten nie gewesen sein

  • @Miclux
    link
    Deutsch
    18 months ago

    “KI wird keine Jobs ersetzen, nur verbessern”

  • @DrunkenPirate@feddit.de
    link
    fedilink
    Deutsch
    -28 months ago

    Gute Idee. Kenne ein Toll, wo das schon erstaunlich gut funktioniert. Kann mir vorstellen, dass es einigen Fremdsprachlern beim Deutschlernen helfen kann.

    • @Anekdoteles@feddit.de
      link
      fedilink
      Deutsch
      28 months ago

      KI-Untertitel sind nach wie vor blanke Scheiße. An den entscheidenden Stellen, wo sie mal Value bringen könnten, versagen sie in aller Regel. Aber gut, mein Bild ist natürlich sehr von diesen unsäglichen Untertiteln geprägt, die einem in den meisten Kurzvideos aufgezwungen werden und mehr irritieren als nützen.