Нынешние системы устного перевода распознают речь, превращают ее в текст, а затем произносят его на иностранном языке. Такие устройства в принципе не в состоянии не совершать ошибок - особенно в случае с японским языком, где очень много слов, которые звучат одинаково, но пишутся разными иероглифами и имеют разный смысл. Поэтому новая система должна научиться распознавать обстановку, в которой идет разговор. Если он происходит, например, на новогодней вечеринке, то слово "кампай" наверняка будет означать тост "на здоровье!", а вовсе не пугающий военный термин "полный разгром", который по-японски произносится точно так же - "кампай".
Новая система будет к тому же сканировать лицо говорящего и определять его душевное состояние. Это позволит, например, японское выражение "сидзука-ни" в одном случае перевести, как "попрошу тишины", а в другом - передать грубым словом "заткнись!"
Система также должна научиться тщательно следить за губами говорящего, чтобы по их движениям разобрать нечетко произнесенные слова. Устройство предполагается применять, в частности, в ходе телеконференций, оно может быть использовано в магазинах, ресторанах и т.д.