Passa ai contenuti principali

Windows 8.1 Store Apps: Text 2 Speech

Con l’arrivo di Windows 8.1 sono arrivate anche una miriade di API con nuove funzionalità interessanti.

Una di queste, già presente tra le API a disposizione di chi sviluppa per Windows Phone 8, è quella relativa al Text To Speech (TTS), cioè alla possibilità che abbiamo di far “parlare” la nostra Windows Store App.

Per chi conosce le API a disposizione di WP8, le API per Windows 8.1 prevedono un approccio differente.

Le nuove API, dato un testo o un file SSML, permettono di ottenere uno stream audio (vedremo in seguito di che tipo) che, per essere riprodotto, deve essere dato in pasto ad un MediaElement.

La seguente figura mostra il flusso da seguire per far parlare la nostra app:

 

image

Supponendo di avere la seguente interfaccia XAML (molto semplice):

<Page
    x:Class="Text2Speech.MainPage"
    xmlns="http://schemas.microsoft.com/winfx/2006/xaml/presentation"
    xmlns:x="http://schemas.microsoft.com/winfx/2006/xaml"
    xmlns:local="using:Text2Speech"
    xmlns:d="http://schemas.microsoft.com/expression/blend/2008"
    xmlns:mc="http://schemas.openxmlformats.org/markup-compatibility/2006"
    mc:Ignorable="d">

    <Grid Background="{StaticResource ApplicationPageBackgroundThemeBrush}">
        <Grid.RowDefinitions>
            <RowDefinition Height="Auto"/>
            <RowDefinition Height="Auto"/>
            <RowDefinition Height="*"/>
        </Grid.RowDefinitions>
        <TextBox Name="txtText" Grid.Row="0" HorizontalAlignment="Left" TextWrapping="Wrap" Text="TextBox" VerticalAlignment="Top" Width="200" Margin="10"/>
        <Button Grid.Row="1" Content="Text2Speech" HorizontalAlignment="Left" VerticalAlignment="Top" Margin="10" Click="Button_Click"/>
        <MediaElement x:Name="Audio"/>
    </Grid>
</Page>

 

Il codice necessario per far pronunciare, nella lingua di default, il testo inserito nel textbox è il seguente:

Using synth = New Windows.Media.SpeechSynthesis.SpeechSynthesizer
    Dim synthStream As Windows.Media.SpeechSynthesis.SpeechSynthesisStream
    Try
        synthStream = Await synth.SynthesizeTextToStreamAsync(txtText.Text)
    Catch ex As Exception
        synthStream = Nothing
    End Try
    If synthStream Is Nothing Then
        Dim dialog = New MessageDialog("Error during Synthetize")
        Await dialog.ShowAsync()
    Else
        Audio.AutoPlay = True
        Audio.SetSource(synthStream, synthStream.ContentType)
        Audio.Play()
    End If
End Using

 

La classe da utilizzare per “sintetizzare” il testo è la SpeechSynthesizer.

Utilizzando il metodo SynthesizeTextToStreamAsync (rigorosamente asincrono), otteniamo lo stream di sintesi vocale (di tipo SpeechSynthesisStream) che possiamo impostare come sorgente di un MediaElement e riprodurlo.

La classe SpeechSynthesizer espone anche il metodo SynthesizeSsmlToStreamAsync per eseguire la sintesi di un file SSML (per lo standard SSML vedere http://www.w3.org/TR/speech-synthesis/) il cui funzionamento è identico al precedente.

Infine, la stessa classe può essere utilizzata per recuperare l’insieme delle lingue disponibili nel sistema. La proprietà statica InstalledVoices restituisce la collezione di VoiceInformation relative a tutte le lingue installate nel sistema. Attualmente ci sono 17 lingue disponibili (ma non l’italiano).

In ogni caso, se volessimo la prima lingua italiana presente nel sistema (qualora esistesse), potremmo scrivere:

Dim voices = Windows.Media.SpeechSynthesis.SpeechSynthesizer.AllVoices

Dim italianVoice = voices.Where(Function(v) v.Language = "it-IT").FirstOrDefault()

 

ItalianVoice e’ un’istanza di classe VoiceInformation al cui interno troviamo le informazioni relative alla voce:

image

Per  impostare la lingua desiderata prima di eseguire lo speech, utilizziamo la proprietà Voice della classe SpeechSynthesizer.

Private Sub SetItalianVoice(synth As Windows.Media.SpeechSynthesis.SpeechSynthesizer)
    Dim voices = Windows.Media.SpeechSynthesis.SpeechSynthesizer.AllVoices
    Dim italianVoice = voices.Where(Function(v) v.Language = "it-IT").FirstOrDefault()
    If italianVoice IsNot Nothing Then
        synth.Voice = italianVoice
    End If
End Sub

 

Per maggiori informazioni sul namespace relativo al Text To Speech, l’indirizzo MSDN è http://msdn.microsoft.com/en-us/library/windows/apps/windows.media.speechsynthesis.aspx

Un esempio (C#, Javascript e C++) è disponibile all’ indirizzo http://code.msdn.microsoft.com/windowsapps/Speech-synthesis-sample-6e07b218

 

Commenti

Post popolari in questo blog

VB for Dummies: La serializzazione – parte 2

Questo post è la continuazione del precedente post sulla serializzazione. In particolare vedremo la serializzazione SOAP e quella JSON.   Serializzazione SOAP La serializzazione SOAP è demandata alla classe SOAPFormatter contenuta nel namespace System.Runtime.Serialization.Formatters.Soap contenuto nella libreria omonima. Il formatter SOAP risale alle primissime versioni del framework e, purtroppo, da un certo punto in poi, pur non essendo stato dichiarato obsoleto, non è stato portato avanti nello sviluppo e non supporta alcuni tipi di dati usatissimi nel mondo .NET quali i generici e i nullable. Per questo motivo, non possiamo serializzare in formato SOAP (utilizzando il SOAPFormatter) la nostra Fattura (vedi post precedente) poichè questa ha una proprietà di tipo List(Of DettagliFattura) (generico).   Serializzazione JSON Il formato di serializzazione JSON (maggiori info qui ) è un formato testuale molto in voga nelle applicazioni AJAX. Si trata di un mod...

Recensione: Windows Runtime via C#

Può sembrare strano che un VB-ista legga un libro su C#, ma come diceva Sun Tzu: “ Se conosci il tuo nemico, conosci te stesso ”. A parte gli scherzi, il libro vale la pena di essere letto a prescindere dal linguaggio .NET con cui si lavora. Oltre  290 pagine dedicate agli aspetti fondamentali dello sviluppo con Windows Runtime per le Windows Store App. I prerequisiti per poter leggere il libro sono la conoscenza di C# e di Visual Studio e gli autori non danno per scontato quasi nulla partendo dai concetti di base quali il type system e i suoi principi (argomento che di solito è saltato a piedi pari da chi si avvicina al mondo WinRT dal framework completo e che, se non compreso, può dare problemi nello sviluppo quotidiano). Tra i concetti che possiamo definire “core”, troviamo anche i capitoli dedicati all’app packaging e al process model, entrambi ben strutturati e chiari. Già solo questi tre capitoli iniziali giustificherebbero, in un certo qual modo, l’acquisto del libro, ...

Alla scoperta del Kinect : questione di profondità

Nei due precedenti post ( link e link ) abbiamo fatto conoscenza con “l’aggeggio” kinect e visto come sia possibile, in maniera molto semplice, gestire lo stream video proveniente dalla camera. In questo post diamo un’occhiata alla capacità che ha il Kinect di fornire frame in cui l’immagine non è la rappresentazione fedele della realtà che ci circonda ma la rappresentazione bidimensionale della distanza degli oggetti dai sensori di profondità. L’aggeggio, infatti, dispone di un sensore di profondità che è in grado di fornirci la distanza dei punti inquadrati da se stesso e, in più, è in grado di dirci a quale “player” fa riferimento ogni singolo pixel. Ma andiamo con ordine. Per abilitare la ricezione del depth stream è necessario: Istanziare la classe Runtime; Agganciare il gestore dell’evento DepthFrameReady; Inizializzare l’istanza della Runtime scegliendo una delle opzioni che abilitano il sensore di profondità; Aprire lo stream dei dati relativi alla pro...