SSOAR Logo
    • Deutsch
    • English
  • Deutsch 
    • Deutsch
    • English
  • Einloggen
SSOAR ▼
  • Home
  • Über SSOAR
  • Leitlinien
  • Veröffentlichen auf SSOAR
  • Kooperieren mit SSOAR
    • Kooperationsmodelle
    • Ablieferungswege und Formate
    • Projekte
  • Kooperationspartner
    • Informationen zu Kooperationspartnern
  • Informationen
    • Möglichkeiten für den Grünen Weg
    • Vergabe von Nutzungslizenzen
    • Informationsmaterial zum Download
  • Betriebskonzept
Browsen und suchen Dokument hinzufügen OAI-PMH-Schnittstelle
JavaScript is disabled for your browser. Some features of this site may not work without it.

Download PDF
Volltext herunterladen

(194.2 KB)

Zitationshinweis

Bitte beziehen Sie sich beim Zitieren dieses Dokumentes immer auf folgenden Persistent Identifier (PID):
https://nbn-resolving.org/urn:nbn:de:0168-ssoar-66084-2

Export für Ihre Literaturverwaltung

Bibtex-Export
Endnote-Export

Statistiken anzeigen
Weiterempfehlen
  • Share via E-Mail E-Mail
  • Share via Facebook Facebook
  • Share via Bluesky Bluesky
  • Share via Reddit reddit
  • Share via Linkedin LinkedIn
  • Share via XING XING

Speaker trait characterization in web videos: Uniting speech, language, and facial features

[Konferenzbeitrag]

Weninger, Felix
Wagner, Claudia
Wöllmer, Martin
Schuller, Björn
Morency, Louis-Philipp

Abstract

We present a multi-modal approach to speaker characterization using acoustic, visual and linguistic features. Full realism is provided by evaluation on a database of real-life web videos and automatic feature extraction including face and eye detection, and automatic speech recognition. Differen... mehr

We present a multi-modal approach to speaker characterization using acoustic, visual and linguistic features. Full realism is provided by evaluation on a database of real-life web videos and automatic feature extraction including face and eye detection, and automatic speech recognition. Different segmentations are evaluated for the audio and video streams, and the statistical relevance of Linguistic Inquiry and Word Count (LIWC) features is confirmed. In the result, late multimodal fusion delivers 73, 92 and 73% average recall in binary age, gender and race classification on unseen test subjects, outperforming the best single modalities for age and race.... weniger

Thesaurusschlagwörter
Video; Video-Clip; Aufzeichnung; Computerlinguistik; Internet; Evaluation; Soziale Medien; Experiment; audiovisuelle Medien

Klassifikation
Naturwissenschaften, Technik(wissenschaften), angewandte Wissenschaften

Freie Schlagwörter
speaker classification; computational paralinguistics; multi-modal fusion; Linguistic Inquiry and Word Count; LIWC

Titel Sammelwerk, Herausgeber- oder Konferenzband
Proceedings of the 38th International Conference on Acoustics, Speech and Signal Processing (ICASSP 2013)

Konferenz
38. International Conference on Acoustics, Speech and Signal Processing (ICASSP 2013). Vancouver, 2013

Sprache Dokument
Englisch

Publikationsjahr
2013

Verlag
IEEE

Seitenangabe
S. 3647-3651

DOI
https://doi.org/10.1109/ICASSP.2013.6638338

ISSN
2379-190X

ISBN
978-1-4799-0356-6

Status
Veröffentlichungsversion; begutachtet (peer reviewed)

Lizenz
Deposit Licence - Keine Weiterverbreitung, keine Bearbeitung


GESIS LogoDFG LogoOpen Access Logo
Home  |  Impressum  |  Betriebskonzept  |  Datenschutzerklärung
© 2007 - 2025 Social Science Open Access Repository (SSOAR).
Based on DSpace, Copyright (c) 2002-2022, DuraSpace. All rights reserved.
 

 


GESIS LogoDFG LogoOpen Access Logo
Home  |  Impressum  |  Betriebskonzept  |  Datenschutzerklärung
© 2007 - 2025 Social Science Open Access Repository (SSOAR).
Based on DSpace, Copyright (c) 2002-2022, DuraSpace. All rights reserved.