Controlled English for knowledge representation

Controlled English for knowledge representation

phdthesis
Schon seit langem existiert in der Informatik das Forschungsgebiet der Wissensrepräsentation, das die automatische Interpretation menschlichen Wissens durch Computer möglich machen soll. Den meisten Ansätzen mangelte es aber an guten Benutzerschnittstellen. Es stellte sich heraus, dass die Benutzer grosse Mühe haben mit dem Erlernen und der Anwendung der Logik-basierten Sprachen, in welchen das Wissen kodiert werden muss. Ein neuer Ansatz für intuitive und gleichzeitig zuverlässige Benutzerschnittstellen für Wissensrepräsentationssysteme besteht in der Verwendung von kontrollierter natürlichen Sprache. Damit sind Teilmengen natürlicher Sprachen gemeint, die durch gewisse Einschränkungen automatisch in formale Logik übersetzt werden können. In der Vergangenheit wurden bereits etliche solcher Sprachen entwickelt, wobei aber meist nur prototypische Programme resultierten. Des Weiteren konnte bis jetzt niemand wirklich beweisen, dass diese Sprachen in der Tat einfacher zu verstehen sind als andere Logik-basierte Sprachen. Das Ziel dieser Dissertation ist es, das Forschungsgebiet der kontrollierten natürlichen Sprachen zur Wissensrepräsentation in eine neue Richtung zu lenken: von den gegenwärtigen “proof-of-concept"-basierten Ansätzen zu einer Betrachtungsweise, die sich mehr am Ingenieurwesen orientiert. Aus diesem Grund präsentiere ich theoretische und praktische Bausteine für die Entwicklung und Anwendung von kontrolliertem Englisch zur Wissensrepräsentation. Zunächst zeige ich mit der Einführung einer neuartigen Grammatiknotation, wie solche Sprachen in adäquater und einfacher Weise de_niert werden können, und ich beschreibe effziente Algorithmen um solche Grammatiken zu verarbeiten. Als nächstes demonstriere ich, wie diese theoretischen Konzepte umgesetzt werden können und wie kontrollierte natürliche Sprache in Wissensrepräsentationswerkzeuge eingebettet werden kann, sodass intuitive und mächtige Benutzerschnittstellen entstehen, die auch für ungeübte Anwender zugänglich sind. Schliesslich erörtere ich, wie die Verständlichkeit von kontrollierten natürlichen Sprachen evaluiert werden kann. Ich lege dar, dass dies mit den existierenden Ansätzen nicht in zuverlässiger Weise möglich ist, und präsentiere deshalb ein neuartiges Testsystem. Auf diesem System basierende Experimente zeigen, dass kontrollierte natürliche Sprachen nicht nur einfacher zu verstehen sind als vergleichbare Sprachen, sondern auch weniger Lernzeit benötigen und von den Benutzern bevorzugt werden.
Tobias Kuhn
Norbert E. Fuchs
Knowledge representation is a long-standing research area of computer science that aims at representing human knowledge in a form that computers can interpret. Most knowledge representation approaches, however, have suffered from poor user interfaces. It turns out to be difficult for users to learn and use the logic-based languages in which the knowledge has to be encoded. A new approach to design more intuitive but still reliable user interfaces for knowledge representation systems is the use of controlled natural language (CNL). CNLs are subsets of natural languages that are restricted in a way that allows their automatic translation into formal logic. A number of CNLs have been developed but the resulting tools are mostly just prototypes so far. Furthermore, nobody has yet been able to provide strong evidence that CNLs are indeed easier to understand than other logic-based languages. The goal of this thesis is to give the research area of CNLs for knowledge representation a shift in perspective: from the present explorative and proof-of-concept-based approaches to a more engineering focused point of view. For this reason, I introduce theoretical and practical building blocks for the design and application of controlled English for the purpose of knowledge representation. I first show how CNLs can be defined in an adequate and simple way by the introduction of a novel grammar notation and I describe efficient algorithms to process such grammars. I then demonstrate how these theoretical concepts can be implemented and how CNLs can be embedded in knowledge representation tools so that they provide intuitive and powerful user interfaces that are accessible even to untrained users. Finally, I discuss how the understandability of CNLs can be evaluated. I argue that the understandability of CNLs cannot be assessed reliably with existing approaches, and for this reason I introduce a novel testing framework. Experiments based on this framework show that CNLs are not only easier to understand than comparable languages but also need less time to be learned and are preferred by users.
Controlled English for knowledge representation
2010
04
University of Zurich, Department of Informatics
cl