Details One-Pass to Reason + Die (hypersphärische) Dynamik von Halluzinationen | Details zu zwei 30-minütigen Vorträgen Dies wird eine Journal-Club-Veranstaltung sein. Zwei Vorträge: One-Pass to Reason: Token Duplication and Block-Sparse Mask for Efficient Fine-Tuning on Multi-Turn Reasoning (NeurIPS 2025 Workshop) Link zum Paper The (Hyper-spherical) Geometry and Dynamics of Hallucinations. Basierend auf Artikeln: „Eine geometrische Taxonomie der Halluzination in LLMs“, Marin 2026 https://arxiv.org/pdf/2602.13224v3 „How Transformers Reject Wrong Answers: Rotational Dynamics of Factual Constraint Processing“, Marin 2026 https://arxiv.org/abs/2603.13259 „Text Corpora as Concept Fields: Black-Box Halluzination und Neuheitsmessung“, Kersting et al. 2026 https://arxiv.org/pdf/2605.05103" Referenten Ritesh Goru, Mitglied des technischen Personals bei DevRev; Prateek Jain, Ingenieur für maschinelles Lernen bei DevRev Connor Favreau, PhD, Principal Data Scientist bei Central Health Zusammenfassung 1. Die Feinabstimmung von Large Language Models (LLMs) auf Multi-Turn-Argumentationsdatensätzen erfordert N (Anzahl der Runden) separate Vorwärtsdurchgänge pro Konversation aufgrund der Sichtbarkeit des Reasoning-Tokens Einschränkungen, da Argumentationstokens für eine Runde in nachfolgenden Runden verworfen werden. Wir beweisen, dass unsere Methode identische Verluste wie der N-Pass-Ansatz erzeugt und gleichzeitig die gleiche Speicherkomplexität für ein transformatorbasiertes Modell beibehält. 2. RAG- und LLM-as-Judge-Systeme gehören zu den am häufigsten verwendeten Ansätzen für Halluzinationen Diese Methoden sind jedoch nicht narrensicher und erfordern häufig zusätzliche Validierungsebenen, während ihnen deterministische oder direkt messbare Vorstellungen von semantischer Korrektheit fehlen. Stattdessen basiert eine wachsende Klasse von Halluzinationserkennungstechniken auf spezifischen geometrischen oder dynamischen Eigenschaften des Einbettungsraums, die entweder aus den verborgenen Darstellungen des Modells selbst oder aus separaten Einbettungsmodellen abgeleitet werden. Dazu gehören hypersphärische Geometrie, semantische Regionalität, bahnbasierte Methoden und neue, von der Physik inspirierte Techniken zum Verstehen und Erkennen von Halluzinationen in großen Sprachmodellen. Die Gruppe trifft sich normalerweise jeden ersten Dienstag im Monat, um Forschungspublikationen zu diskutieren, die den Grundstein für ML/DL legen oder neue vielversprechende Ideen untersuchen. Von den Teilnehmern wird erwartet, dass sie die Veröffentlichungen lesen Veröffentlichungen, um zur Diskussion beizutragen und von anderen zu lernen. Dies ist auch eine großartige Gelegenheit, Ihre Implementierungen vorzustellen und Feedback von anderen Sponsoren zu erhalten. Klicken Sie hier, um sich für die Unterstützung von Austin Deep Learning zu engagieren.
Die bereitgestellten Informationen stellen keine Handelsberatung dar. kdj.com übernimmt keine Verantwortung für Investitionen, die auf der Grundlage der in diesem Artikel bereitgestellten Informationen getätigt werden. Kryptowährungen sind sehr volatil und es wird dringend empfohlen, nach gründlicher Recherche mit Vorsicht zu investieren!
Wenn Sie glauben, dass der auf dieser Website verwendete Inhalt Ihr Urheberrecht verletzt, kontaktieren Sie uns bitte umgehend (info@kdj.com) und wir werden ihn umgehend löschen.