Talking to the semantic web : natural language query interf...

Talking to the semantic web : natural language query interfaces for casual end-users

phdthesis
Die Vision des “Semantic Web” ist die Entwicklung einer zusätzlichen semantischen Metaebene zum bestehenden World Wide Web, sodass eine verteilte, dynamisch wachsende Wissensbasis entsteht. Zu diesem Zweck ist das Semantic Web auf einem formalen, logik-basierten Grundgerüst aufgebaut, das eine präzise und effiziente Suche nach Informationen ermöglicht. Gelegentliche oder nicht in Logik geschulte Endbenutzer sind jedoch typischerweise mit Logik überfordert; sie sind zum Teil sogar ausserstande, die formalen logischen Konzepte zu beherrschen. Die grundlegende Frage ist also: Wie können wir den realen Endbenutzern helfen, Informationen in einem semantischen Web zu finden, das sie nicht verstehen? Eine Möglichkeit, diese Lücke zu schliessen, ist die Verwendung von natürlichsprachlichen Zugangs- oder Abfragesystemen. Ein solches natürlichsprachliches Interface erlaubt dem Benutzer den Zugang zu einer Datenbasis, indem eine Anfrage in natürlicher Sprache formuliert wird. Jedoch erfordern leistungsfähige natürlichsprachliche Abfragesysteme rechenintensive Algorithmen und einen immensen Gebrauch von Hintergrundwissen, was zu einem sehr hohen Grad an Domänenabhängigkeit und zu einer Nicht-Portabilität der Systeme führt. Auf der anderen Seite erlauben natürlichsprachliche Interfaces den Endbenutzern, auf eine vertraute und natürliche Weise nach Informationen suchen. Trotzdem kann ein solches Abfragesystem nur effizient genutzt werden, wenn der Endbenutzer weiss, welche Fragen gestellt werden können, da auch ein natürlichsprachliches Suchsystem präzise formulierte Anfragen verlangt, damit diese adäquat verarbeitet und beantwortet werden können. Diese Dissertation fordert, dass die Dichotomie zwischen formalen, logik-basierten Abfragesprachen und natürlichen Abfragesprachen aufgebrochen wird. Dabei werden die Freiheit/Natürlichkeit von natürlichen Abfragesprachen und die Formalität/Strukturiertheit von formalen Abfragesprachen als Enden eines Formalitätskontinuums aufgefasst. Auf der Basis dieses Formalitätskontinuums werden zwei Hypothesen aufgestellt: (1) Das Portabilitätsproblem von natürlichsprachlichen Interfaces, die am natürlichen Ende des Kontinuums liegen, kann bewältigt werden, ohne dass komplexe, aufwändige Algorithmen und zeitraubende Implementationsefforts erbracht werden müssen, indem das nötige Wissen, um den natürlichsprachlichen Input adäquat verarbeiten zu können, automatisch aus semantik-reichen Wissensbasen, wie sie das Semantic Web bietet, extrahiert wird. (2) Die zweite Hypothese besagt, dass natürlichsprachliche Abfragesysteme den Endbenutzern bei der Frageformulierung eine gewisse Kontrollstruktur und Einschränkung vorgeben sollen, damit diese durch den Prozess der Anfrageformulierung geführt werden können. Doch die Abfragesprache soll nicht zu formal und strukturiert sein, damit der “normale” Benutzer nicht abgeschreckt wird. Somit liegen die für den realen Endbenutzer sowie auch aus entwicklungstechnischer Sicht besten Suchsystemlösungen irgendwo in der Mitte des Formalitätskontinuums. Um die beiden Hypothesen zu testen, wurden vier verschiedene Zugangssysteme zu ontologie-basierten Daten entwickelt, die an verschiedenen Positionen im Formalitätskontinuum liegen: NLP-Reduce, Querix, Ginseng und Semantic Crystal. Die ersten beiden Systeme erlauben den Benutzern, ihre Anfragen in voller oder leicht eingeschränkter natürlicher Sprache zu formulieren. Das dritte Interface verlangt eine Anfrageformulierung in einer kontrollierten Sprache, die dem Englischen sehr ähnlich ist. Semantic Crystal gehört zu den formalen Suchsystemen, da es eine formale, wenn auch grafisch dargestellte Abfragesprache aufweist. Alle vier Systeme vermeiden eine komplexe, rechenintensive Konfiguration, bieten dennoch performante und mächtige Werkzeuge für nicht-logik-geschulte Endbenutzer bei der Formulierung von komplexen Anfragen zu ontologie-basierten Daten. Auf der Basis des Formalitätskontinuums und der vier Systeme werden zwei Evaluationen präsentiert: (1) eine Retrieval-Performanz-Evalution und (2) eine Benutzerstudie. Bei der Performanzevaluation wurden die drei natürlichsprachlichen Suchsysteme NLP-Reduce, Querix und Ginseng mit drei existierenden Konkurrenzinterfaces im Hinblick auf die Qualität der Informationsfindung und Systemportabilität einem Benchmark-Test mit drei Datensätzen unterzogen. Die Benutzerstudie umfasste einen Benchmark-Test mit allen vier Suchsystemen in einem kontrollierten Experiment mit 48 realen Endbenutzern. Diese beiden Evaluationen liefern reichlich Anhaltspunkte über die Vor- und Nachteile von Suchsystemen an verschiedenen Positionen des Formalitätskontinuums. Ferner geben sie konkrete Antworten auf die beiden Hypothesen, wo also auf dem Kontinuum die besten Lösungen aus systemtechnischer Sicht sowie, und vor allem, aus Endbenutzersicht liegen. Die Dissertation zeigt, dass natürlichsprachliche Abfragesysteme ein komfortables sowie zuverlässiges Hilfsmittel offerieren, und somit einen möglichen Schlüssel bilden, um die Potentiale des Semantic Web einem breiten Endbenutzerpublikum zugänglich zu machen. Das alles überspannende Ziel dieser Dissertation ist letztendlich, die theoretische Vision des Semantic Web einen kleinen Schritt in die Realität umzusetzen.
Esther Kaufmann
Abraham Bernstein
The Semantic Web presents the vision of a distributed, dynamically growing knowledge base founded on formal logic. This formal framework facilitates precise and effective querying in order to manage information-seeking tasks. Casual end-users, however, are typically overwhelmed by the formal logic. So how can we help users to query a Web of logic that they do not seem to understand? One solution to address this problem is the use of natural language for query specification, but the development of natural language interfaces requires computationally and conceptually intensive algorithms relying on large quantities of domain-dependent background knowledge, thereby making them virtually unadaptable to new domains and applications, or achievable only by sacrificing retrieval performance. Furthermore, while natural language interfaces hide prohibitive formal query languages, users should know their capabilities in order to utilize the natural language interface successfully. This thesis proposes to break the dichotomy between full natural language and formal approaches by regarding them as ends of a Formality Continuum, where the freedom of full natural languages and the structuredness of formal query languages lie at the ends of the continuum. We hypothesize that portable natural language interfaces to the Semantic Web with high retrieval performance can be built, thereby avoiding a complex configuration by controlling the query language and by extracting the necessary under lying frameworks from ontology-based knowledge bases, since such knowledge bases offer a rich source of semantically annotated information. We further hypothesize that query interfaces for the casual user should impose some structure on the user ’s input in order to guide the entry, but should not overly restrict the user with an excessively formalistic language. In this way, the best solutions for casual end-users lie somewhere between the freedom of a full natural language and the structuredness of a formal query language. To support our proposition we introduce, in a first step, four different, domain-independent query interfaces to the Semantic Web that lie at different positions of the Formality Continuum: NLP-Reduce, Querix, Ginseng, and Semantic Crystal. The first two interfaces allow users to pose questions in almost full or slightly controlled English. The third interface offers query formulation in a controlled language akin to English. The last interface belongs to the formal approaches, as it exhibits a formal, but graphically displayed query language. The interfaces are simple in configuration, but still offer wellperforming and appropriate tools for composing queries to ontology-based data for casual end-users. As a second step, we present two evaluations to test our hypotheses: (1) an in-depth retrieval performance evaluation with three test sets comparing our interfaces with three existing systems and (2) a comprehensive usability study with real-world end-users assessing our interfaces and, in particular, their query languages. The two evaluations provide sufficient evidence to determine the advantages and disadvantages of query interfaces at various points along the Formality Continuum. In turn, they lead to concrete answers to our hypotheses. The thesis shows that natural language interfaces provide a convenient as well as reliable means of querying access to the Semantic Web and, hence, a realistic potential for bridging the gap between the formal logic of the Semantic Web and the casual end users. As such, its overarching contribution is one step towards the theoretical vision of the Semantic Web becoming reality.
Talking to the semantic web : natural language query interfaces for casual end-users
2009
Universität Zürich
ddis