1
00:00:00,690 --> 00:00:32,289
Sous-titres générés avec IA (Whisper), editing et proofing par Guglielmo Fernandez Garcia. 
Depuis un peu plus d'un an, on entend parler d'intelligence artificielle partout.

2
00:00:32,289 --> 00:00:36,250
Image, Traduction, Développement, Texte, tous les domaines sont touchés.

3
00:00:36,250 --> 00:00:41,929
La référence dans le domaine, c'est évidemment ChatGPT, l'agent conversationnel d'OpenAI

4
00:00:41,929 --> 00:00:46,170
capable de générer à peu près tout ce que vous voulez, et qui, tous les mois,

5
00:00:46,170 --> 00:00:49,770
ne cesse de connaître des évolutions toujours plus impressionnantes.

6
00:00:49,770 --> 00:00:53,329
Vous l'aurez compris, ça fait déjà quelques émissions qu'on l'évoque, on ne pouvait

7
00:00:53,329 --> 00:00:57,409
pas esquiver le sujet plus longtemps, aujourd'hui on va enfin parler d'intelligence

8
00:00:57,409 --> 00:00:58,409
artificielle.

9
00:00:58,490 --> 00:01:02,929
Qui de mieux placer pour nous parler d'IA que quelqu'un qui a contribué à la recherche

10
00:01:02,929 --> 00:01:03,929
en IA ?

11
00:01:03,929 --> 00:01:07,530
Aujourd'hui, nous recevons Aurélie Lemaitre, maître de conférences à l'université

12
00:01:07,530 --> 00:01:14,409
Rennes 2, membre de l'IRISA et surtout chercheuse sur Collapscore, un projet d'intelligence

13
00:01:14,409 --> 00:01:17,209
artificielle visant à reconnaître des partitions musicales.

14
00:01:17,209 --> 00:01:21,450
Alors, comment fonctionne ce genre d'outils ? Une IA peut-elle réellement apprendre ?

15
00:01:21,450 --> 00:01:25,489
Peut-on réellement faire confiance aux résultats produits par une intelligence

16
00:01:25,489 --> 00:01:26,489
artificielle ?

17
00:01:30,569 --> 00:01:35,129
Pour nous intéresser aux IA, avec Guglielmo, on s'est penché sur le cas d'une IA, donc

18
00:01:35,129 --> 00:01:37,129
celle issue du projet Collapscore.

19
00:01:37,129 --> 00:01:40,730
Le travail d'Aurélie Lemaitre, c'est de s'intéresser aux documents anciens.

20
00:01:40,730 --> 00:01:44,810
En partenariat avec la Bibliothèque nationale de France, elle dispose d'un corpus de

21
00:01:44,810 --> 00:01:46,450
partitions de musiques anciennes.

22
00:01:46,450 --> 00:01:52,209
A partir des scans de partitions, l'objectif du projet Collapscore est de les interpréter.

23
00:01:52,209 --> 00:01:56,650
Le système de reconnaissance va alors lire les notes et les renvoyer dans un

24
00:01:56,650 --> 00:01:59,329
format numérique, comme le format MIDI par exemple.

25
00:01:59,329 --> 00:02:04,209
De cette façon, ce travail en intelligence artificielle participe à la préservation

26
00:02:04,209 --> 00:02:05,489
du patrimoine musical.

27
00:02:06,730 --> 00:02:08,370
Pour ces voyages, commençons à douceur.

28
00:02:08,370 --> 00:02:11,849
Nous pouvons imaginer l'IA comme une boîte noire à laquelle nous posons une

29
00:02:11,849 --> 00:02:15,449
question, c'est-à-dire nous fournissons des données, et à laquelle nous attendons

30
00:02:15,449 --> 00:02:19,009
une réponse, nos données traitées selon la logique de la machine.

31
00:02:19,009 --> 00:02:22,729
Ce qui se passe à l'intérieur est le domaine des experts, c'est-à-dire

32
00:02:22,729 --> 00:02:27,689
que moi, l'utilisateur, je sais que quelqu'un sait comment cela fonctionne,

33
00:02:27,689 --> 00:02:29,569
mais ça ne m'intéresse pas, ou pas.

34
00:02:29,569 --> 00:02:33,810
Les problèmes avec l'IA, c'est que même les experts ne savent pas vraiment

35
00:02:33,810 --> 00:02:35,370
comment ça marche à l'intérieur.

36
00:02:35,370 --> 00:02:40,370
Commençons donc pour demander à Aurélie ce qu'elle donne à sa machine,

37
00:02:40,370 --> 00:02:43,729
quelle réponse elle attend, et ce qu'elle fait sa boîte noire

38
00:02:43,729 --> 00:02:45,490
à intelligence artificielle.

39
00:02:45,490 --> 00:02:48,770
Et surtout si elle comprend un peu mieux que moi ce qui se passe dedans.

40
00:02:48,770 --> 00:02:52,169
Alors, ce qu'on pourrait appeler intelligence artificielle d'une manière

41
00:02:52,169 --> 00:02:56,930
plus générale, c'est le fait de faire faire à un ordinateur un traitement

42
00:02:56,930 --> 00:02:59,210
que pourrait faire le cerveau humain.

43
00:02:59,210 --> 00:03:04,330
En l'occurrence, si je montre ma partition de musique à un musicien,

44
00:03:04,330 --> 00:03:06,810
il va être capable de me dire « ben ici j'ai une clé de sol,

45
00:03:06,810 --> 00:03:09,610
ici j'ai des notes, j'ai des portées, des partitions ».

46
00:03:09,610 --> 00:03:14,530
Et donc, être capable de donner cette image à un ordinateur,

47
00:03:14,530 --> 00:03:18,569
c'est l'entrée de notre logiciel d'intelligence artificielle.

48
00:03:18,569 --> 00:03:21,729
Et puis quand sort-il, soit capable de nous dire « et bien j'ai lu,

49
00:03:21,729 --> 00:03:25,050
voilà la musique, et je peux même faire de la musique synthétique »,

50
00:03:25,050 --> 00:03:27,930
c'est-à-dire on peut demander à l'ordinateur de nous fabriquer

51
00:03:27,930 --> 00:03:31,969
un fichier MIDI, une piste son de ce qu'il y a sur la partition.

52
00:03:31,969 --> 00:03:33,289
C'est l'objectif final.

53
00:03:33,289 --> 00:03:37,090
Effectivement, quand vous parlez de boîte noire,

54
00:03:37,090 --> 00:03:42,210
c'est le reproche qu'on peut faire à certaines intelligences artificielles,

55
00:03:42,210 --> 00:03:43,490
mais pas à toutes.

56
00:03:43,490 --> 00:03:49,610
C'est là où ce qu'on entend à l'heure actuelle par intelligence artificielle,

57
00:03:49,610 --> 00:03:51,129
tout de suite, c'est le chatGPT.

58
00:03:51,129 --> 00:03:52,729
On lui pose une question, il nous répond.

59
00:03:52,729 --> 00:03:55,810
On ne sait pas d'où il sort sa réponse, mais il a réussi à nous répondre.

60
00:03:55,810 --> 00:03:59,370
Or, avant que ces systèmes de type boîte noire existent,

61
00:03:59,370 --> 00:04:01,250
on faisait déjà de l'intelligence artificielle.

62
00:04:01,250 --> 00:04:02,689
On ne fait pas de l'intelligence artificielle

63
00:04:02,689 --> 00:04:06,370
juste depuis deux ans que les réseaux de neurones existent.

64
00:04:06,370 --> 00:04:07,370
On en fait depuis plus longtemps.

65
00:04:07,370 --> 00:04:11,050
Notamment dans l'équipe Shadok dans laquelle je travaille,

66
00:04:11,050 --> 00:04:14,610
on fait faire de la reconnaissance aux ordinateurs,

67
00:04:14,610 --> 00:04:17,250
c'est-à-dire qu'on fait de l'intelligence artificielle

68
00:04:17,250 --> 00:04:21,769
en se basant sur des systèmes à base de règles syntaxiques,

69
00:04:21,769 --> 00:04:24,050
d'éléments à reconnaître dans les documents.

70
00:04:24,050 --> 00:04:28,170
Alors comme ça, ça fait un peu gros mot mon histoire.

71
00:04:28,170 --> 00:04:32,769
Le principe, c'est qu'on va décrire ce qu'on s'attend à reconnaître dans un document.

72
00:04:32,769 --> 00:04:34,569
Dans une partition musicale,

73
00:04:34,569 --> 00:04:39,449
je m'attends à reconnaître des portées qui sont organisées en système.

74
00:04:39,449 --> 00:04:40,970
Une portée, qu'est-ce que c'est ?

75
00:04:40,970 --> 00:04:43,250
C'est jamais que cinq lignes,

76
00:04:43,250 --> 00:04:46,329
cinq traits horizontaux les uns en dessous des autres.

77
00:04:46,329 --> 00:04:51,129
Et donc, il n'y a pas besoin d'avoir une intelligence artificielle hyper poussée

78
00:04:51,129 --> 00:04:53,129
pour dire dans mon image,

79
00:04:53,129 --> 00:04:57,569
je vais détecter où sont les segments horizontaux, les lignes,

80
00:04:57,569 --> 00:04:59,410
et je vais les regrouper par cinq.

81
00:04:59,410 --> 00:05:02,290
Et ça, ça me fait une portée.

82
00:05:02,290 --> 00:05:04,730
Et dans ce cas-là, le fait d'utiliser des règles,

83
00:05:04,730 --> 00:05:07,209
on a l'avantage de ne pas avoir l'effet boîte noire.

84
00:05:07,209 --> 00:05:08,970
C'est-à-dire que soit notre système,

85
00:05:08,970 --> 00:05:12,569
il trouve les cinq lignes de texte dans l'image et c'est bon, on a la portée.

86
00:05:12,569 --> 00:05:15,449
Soit la cinquième ligne de texte, elle est un petit peu effacée.

87
00:05:15,449 --> 00:05:18,050
Et dans ce cas-là, notre système va dire youhou, j'ai pas trouvé.

88
00:05:18,050 --> 00:05:20,089
Et on va dire bah c'est bon, je sais pourquoi il l'a pas trouvé.

89
00:05:20,089 --> 00:05:22,089
T'as vu, la ligne est effacée.

90
00:05:22,089 --> 00:05:25,449
Et donc ça, c'est déjà en soi une intelligence artificielle

91
00:05:25,449 --> 00:05:27,610
qui n'est pas une boîte noire.

92
00:05:27,610 --> 00:05:30,569
C'est pour ça que je veux dire que toutes les intelligences artificielles

93
00:05:30,569 --> 00:05:32,250
ne sont pas des boîtes noires.

94
00:05:32,250 --> 00:05:34,769
Ce qui est intéressant ici avec Collapscore,

95
00:05:34,769 --> 00:05:37,610
c'est la méthode hybride que le système utilise.

96
00:05:37,610 --> 00:05:41,250
D'un côté, on retrouve la méthode plébiscité des réseaux de neurones,

97
00:05:41,250 --> 00:05:42,569
aussi appelée deep learning.

98
00:05:42,569 --> 00:05:46,610
L'idée est d'entraîner ces réseaux de neurones sur de grandes quantités de données

99
00:05:46,610 --> 00:05:49,970
pour qu'ils puissent apprendre à effectuer des tâches spécifiques.

100
00:05:49,970 --> 00:05:53,649
De l'autre côté, on a donc cette technique des règles syntaxiques

101
00:05:53,649 --> 00:05:56,810
données à la machine pour gagner en efficacité.

102
00:05:56,810 --> 00:05:59,089
Je vais peut-être utiliser un mot pas approprié

103
00:05:59,089 --> 00:06:00,370
quand on parle d'intelligence artificielle,

104
00:06:00,370 --> 00:06:05,889
mais est-ce que dans un sens, vous lui apprenez entre guillemets le solfège ?

105
00:06:05,889 --> 00:06:08,170
Oui, on peut dire ça.

106
00:06:08,170 --> 00:06:13,449
Alors, pour poursuivre du coup sur les deux types d'intelligence artificielle

107
00:06:13,449 --> 00:06:15,329
qu'on met dans notre système,

108
00:06:15,329 --> 00:06:18,930
il y a donc d'une part les règles syntaxiques

109
00:06:18,930 --> 00:06:21,850
qui décrivent ce qu'on s'attend à trouver dans la musique.

110
00:06:21,850 --> 00:06:23,930
Et effectivement, là, on va apprendre le solfège,

111
00:06:23,930 --> 00:06:26,129
c'est-à-dire que notre système, on va lui dire,

112
00:06:26,129 --> 00:06:29,410
en début de portée, tu vas trouver une clé, une clé de sol,

113
00:06:29,410 --> 00:06:32,730
une clé de fa, une clé d'hute selon la complexité des documents.

114
00:06:32,730 --> 00:06:34,769
Et puis après, il va y avoir des mesures.

115
00:06:34,769 --> 00:06:37,889
Là, ce sont des règles qu'on exprime nous-mêmes en tant qu'humains.

116
00:06:37,889 --> 00:06:40,889
Malgré tout, au-delà de ces systèmes de règles,

117
00:06:40,889 --> 00:06:43,649
les méthodes actuelles d'apprentissage artificiel

118
00:06:43,649 --> 00:06:47,170
qui sont basées sur le deep learning,

119
00:06:47,209 --> 00:06:50,129
les réseaux de neurones profonds,

120
00:06:50,129 --> 00:06:52,889
ceux qui sont un petit peu comme des boîtes noires,

121
00:06:52,889 --> 00:06:55,250
on va les entraîner à reconnaître des éléments

122
00:06:55,250 --> 00:06:58,129
qui sont toujours pareils dans notre partition.

123
00:06:58,129 --> 00:07:00,810
Par exemple, les têtes de notes,

124
00:07:00,810 --> 00:07:03,290
les noirs ou les blanches dans les partitions,

125
00:07:03,290 --> 00:07:08,689
un point noir ou une tête de note blanche, une ronde,

126
00:07:08,689 --> 00:07:10,689
c'est quelque chose qu'un réseau de neurones,

127
00:07:10,689 --> 00:07:14,290
un système d'intelligence artificielle peut tout à fait reconnaître.

128
00:07:15,250 --> 00:07:17,129
Là, on ne lui apprend pas le solfège,

129
00:07:17,129 --> 00:07:20,209
mais on lui a montré à notre système tout un tas de partitions

130
00:07:20,209 --> 00:07:21,449
sur lesquelles on lui a dit

131
00:07:21,449 --> 00:07:25,930
là, là et là, il y a des têtes de notes noires

132
00:07:25,930 --> 00:07:28,769
ou là, là et là, il y a des clés de sol

133
00:07:28,769 --> 00:07:30,649
ou là, là et là, il y a des clés de fa.

134
00:07:30,649 --> 00:07:33,329
Et notre système a été entraîné

135
00:07:33,329 --> 00:07:36,970
à reconnaître des symboles isolés dans les partitions.

136
00:07:36,970 --> 00:07:38,089
Peut-être une question un peu poussée,

137
00:07:38,089 --> 00:07:42,370
mais je m'aurais bien resté sur ce concept d'apprentissage moins humain.

138
00:07:42,370 --> 00:07:44,930
Quand j'apprends, j'apprends pas seulement à travers des exemples.

139
00:07:44,930 --> 00:07:46,850
Pour moi, apprendre est une chose plus complexe

140
00:07:46,850 --> 00:07:48,810
qui passe aussi à travers les exemples.

141
00:07:48,810 --> 00:07:50,810
Et les seuls moyens qu'on a pour apprendre

142
00:07:50,810 --> 00:07:53,569
un intelligence artificielle à un ordinateur à faire quelque chose,

143
00:07:53,569 --> 00:07:55,689
c'est de lui montrer des exemples ou des règles

144
00:07:55,689 --> 00:07:57,810
où il y a aussi d'autres façons.

145
00:07:57,810 --> 00:08:00,769
Là où l'apprentissage humain passe aussi par l'expérience, peut-être.

146
00:08:00,769 --> 00:08:02,170
C'est ça, ouais.

147
00:08:02,170 --> 00:08:06,290
Il y a plusieurs familles d'algorithmes d'intelligence artificielle.

148
00:08:06,290 --> 00:08:09,209
Il y a ceux qui apprennent à base de règles.

149
00:08:09,209 --> 00:08:11,689
Je dirais les anciennes versions.

150
00:08:11,730 --> 00:08:16,610
Les récents qui apprennent à base d'exemples étiquetés.

151
00:08:16,610 --> 00:08:21,050
C'est-à-dire qu'il suffit pas de montrer une photo de chat à un algorithme

152
00:08:21,050 --> 00:08:23,329
pour qu'il puisse dire « oh tiens, un chat ».

153
00:08:23,329 --> 00:08:27,170
Non, il faut lui montrer une photo de chat et lui dire « ça, c'est un chat ».

154
00:08:27,170 --> 00:08:30,529
Il ne faut pas lui montrer une photo, il faut lui en montrer des millions.

155
00:08:30,529 --> 00:08:35,409
Il faut lui montrer des millions de photos de chat en lui disant « ça, c'est un chat ».

156
00:08:35,409 --> 00:08:38,570
Et une fois qu'on lui a montré plein de photos de chat

157
00:08:38,570 --> 00:08:40,210
et qu'on lui a aussi montré des photos de chien

158
00:08:40,210 --> 00:08:42,210
en lui disant « ça, c'est un chien ».

159
00:08:42,210 --> 00:08:47,009
Si on lui montre une autre photo qu'il n'a jamais vue,

160
00:08:47,009 --> 00:08:52,090
s'il l'a appris, il peut dire « c'est un chat » ou « c'est un chien ».

161
00:08:52,090 --> 00:08:57,490
Alors est-ce qu'il y a d'autres manières d'entraîner les intelligences artificielles

162
00:08:57,490 --> 00:09:01,690
que de lui montrer des exemples ou de lui donner des règles ?

163
00:09:01,690 --> 00:09:02,769
Oui, ça existe.

164
00:09:02,769 --> 00:09:06,370
C'est ce qu'on appelle l'apprentissage non-supervisé.

165
00:09:06,409 --> 00:09:11,330
C'est-à-dire le fait d'apprendre aux algorithmes à apprendre tout seul.

166
00:09:11,330 --> 00:09:15,649
Par exemple, on montre plein de photos de chat à un algorithme

167
00:09:15,649 --> 00:09:17,289
et on ne lui dit pas que c'est un chat.

168
00:09:17,289 --> 00:09:20,409
Mais on utilise six algorithmes différents.

169
00:09:20,409 --> 00:09:23,289
On leur dit « à ton avis, c'est quoi ? »

170
00:09:23,289 --> 00:09:26,649
Il y en a peut-être quatre qui sont à peu près bien entraînés

171
00:09:26,649 --> 00:09:27,769
qui vont dire « c'est un chat ».

172
00:09:27,769 --> 00:09:29,409
Il y en a deux qui vont dire « c'est un canard ».

173
00:09:29,409 --> 00:09:31,250
On fait un vote à la majorité.

174
00:09:31,250 --> 00:09:33,570
La plupart des algorithmes pensent que c'est un chat.

175
00:09:33,570 --> 00:09:36,169
Donc, OK, on va dire « c'est un chat ».

176
00:09:36,169 --> 00:09:42,610
Et l'algorithme de lui-même fait la moyenne de ce qu'on lui a répondu les autres

177
00:09:42,610 --> 00:09:44,570
pour dire « les autres pensent que c'est un chat ».

178
00:09:44,570 --> 00:09:48,129
OK, je vais apprendre que c'est un chat parce que ça doit être un chat.

179
00:09:48,129 --> 00:09:51,889
Et donc, c'est une manière d'entraîner un algorithme

180
00:09:51,889 --> 00:09:54,809
sans lui avoir dit « cette chose-là, c'est un chat ».

181
00:09:54,809 --> 00:09:57,250
Il l'a deviné lui-même en demandant à d'autres algorithmes

182
00:09:57,250 --> 00:09:58,129
et en faisant la moyenne.

183
00:09:58,129 --> 00:10:01,769
Historiquement, on est passé de apprendre aux machines des règles,

184
00:10:01,769 --> 00:10:05,049
apprendre aux machines des exemples à noter, comme on disait,

185
00:10:05,090 --> 00:10:08,289
à possiblement, dans le futur, la machine qui apprend tout seul.

186
00:10:09,289 --> 00:10:11,690
Alors, elle ne pourra jamais apprendre toute seule

187
00:10:11,690 --> 00:10:13,970
puisque dans l'exemple que je vous ai donné,

188
00:10:13,970 --> 00:10:16,730
pour prendre la décision de « c'est un chat », vous avez vu, j'ai dit

189
00:10:16,730 --> 00:10:19,570
« elle va demander à six autres algorithmes de donner leur avis ».

190
00:10:19,570 --> 00:10:22,970
Donc, elle n'apprend pas toute seule, toute seule.

191
00:10:22,970 --> 00:10:25,529
Je voudrais nuancer un petit peu cet aspect historique.

192
00:10:25,529 --> 00:10:28,850
Règles et exemples à noter parce qu'en fait, au début, les deux cohabitaient.

193
00:10:28,850 --> 00:10:34,970
Les règles et les représentations statistiques de données.

194
00:10:34,970 --> 00:10:39,330
Et puis après, on est passé aux algorithmes basés sur des réseaux de neurones

195
00:10:39,330 --> 00:10:41,570
qui, eux, nécessitent de l'apprentissage supervisé.

196
00:10:41,570 --> 00:10:44,649
Et puis après, notre but, c'est effectivement d'aller vers de l'apprentissage

197
00:10:44,649 --> 00:10:47,929
avec peu de données ou de l'apprentissage faiblement supervisé.

198
00:10:51,320 --> 00:10:53,120
Les faits que les machines apprennent

199
00:10:53,120 --> 00:10:56,480
et que nous cherchons maintenant des moyens de les faire apprendre

200
00:10:56,480 --> 00:11:00,399
à partir des résultats d'autres algorithmes est fascinant.

201
00:11:00,399 --> 00:11:01,240
Mais on révie.

202
00:11:01,240 --> 00:11:03,679
Insiste aussi sur le fait que la plupart des méthodes

203
00:11:03,679 --> 00:11:05,240
sont basées sur des données.

204
00:11:05,240 --> 00:11:10,679
Et la plus grande usine au monde des données, c'est Internet.

205
00:11:11,919 --> 00:11:13,480
On en parle de plus en plus, c'est vrai.

206
00:11:13,480 --> 00:11:16,120
Mais l'une des choses qui a déclenché cette révolution des lias,

207
00:11:16,120 --> 00:11:18,919
c'est le fait qu'à aujourd'hui, chacun et chacune d'entre nous,

208
00:11:18,919 --> 00:11:20,679
dans nos activités quotidiennes,

209
00:11:20,679 --> 00:11:23,679
toi, si t'écoutes AZERTY en ces moments sur une plateforme

210
00:11:23,679 --> 00:11:26,320
et pas pour les ondes, on génère des données.

211
00:11:26,320 --> 00:11:28,120
Quand vous voyez un texte de chatGPT

212
00:11:28,120 --> 00:11:29,600
ou une image de Mid-journey,

213
00:11:29,600 --> 00:11:32,519
vous devez vous dire que peut-être vous avez vous-même

214
00:11:32,519 --> 00:11:34,559
contribué à la création de cette image.

215
00:11:34,559 --> 00:11:36,320
Mais cela crée aussi des problèmes.

216
00:11:36,320 --> 00:11:38,320
Premièrement, si nous croyons de données

217
00:11:38,320 --> 00:11:42,559
et qu'OpenAI crée des modèles et ils gagnent de l'argent avec,

218
00:11:42,559 --> 00:11:44,679
n'est-ce pas que nous ne devrions pas, d'une manière ou d'une autre,

219
00:11:44,679 --> 00:11:46,960
recevoir en partie des fruits de notre travail ?

220
00:11:46,960 --> 00:11:49,559
Et deuxièmement, ces données doivent être annotées.

221
00:11:49,559 --> 00:11:52,360
C'est-à-dire qu'il faut savoir si sur une image d'animal,

222
00:11:52,360 --> 00:11:55,000
par exemple, il y a un chat, un chien ou autre.

223
00:11:55,000 --> 00:11:57,759
Il s'agit là d'un travail fastidieux et chronophage

224
00:11:57,759 --> 00:11:59,519
de faire de ces annotations.

225
00:11:59,519 --> 00:12:00,879
Et qui doit s'en charger ?

226
00:12:00,879 --> 00:12:02,879
Or récemment, les magazines Time a révélé

227
00:12:02,879 --> 00:12:06,080
que OpenAI avait fait appel à des travailleurs et travailleuses

228
00:12:06,080 --> 00:12:08,240
Kenyans pour vérifier les données,

229
00:12:08,240 --> 00:12:10,879
et les payant moins de 2 dollars l'heure.

230
00:12:10,879 --> 00:12:14,600
Il est donc faux dépensé qu'il y a un ordinateur qui apprend tout seul,

231
00:12:14,600 --> 00:12:18,519
car elle s'appuie sur une quantité incroyable de travail humain,

232
00:12:18,519 --> 00:12:22,080
souvent peu ou pas rémunérée, sous la forme des données annotées.

233
00:12:22,080 --> 00:12:24,159
Bon, ici c'est pendant qu'on parle de musique.

234
00:12:24,159 --> 00:12:27,600
Et il est un peu plus difficile de annoter une partition musicale

235
00:12:27,600 --> 00:12:29,080
qui est une image des chiens et des chats.

236
00:12:29,080 --> 00:12:31,399
Il faut un minimum de connaissances de musique.

237
00:12:31,480 --> 00:12:33,639
Et je me sens de coup de demander Aurélie,

238
00:12:33,639 --> 00:12:36,480
comment ils ont abordé les sujets de l'annotation de données,

239
00:12:36,480 --> 00:12:40,840
et s'ils ont un armé de musiciens qui leur annotent les partitions ?

240
00:12:40,840 --> 00:12:43,840
Oui, il existe tout un tas de chercheurs dans le monde entier

241
00:12:43,840 --> 00:12:47,720
qui travaillent sur la reconnaissance d'images de partitions musicales.

242
00:12:47,720 --> 00:12:52,679
Et donc il existe des bases de données qui sont disponibles,

243
00:12:52,679 --> 00:12:56,840
des bases de données notamment de symboles musicaux,

244
00:12:56,840 --> 00:13:00,159
donc des chercheurs qui ont annoté effectivement

245
00:13:00,720 --> 00:13:02,960
des pages dans lesquelles ils ont à noter

246
00:13:02,960 --> 00:13:08,240
mille clés de sol, mille clés de fa, des milliers de têtes noires.

247
00:13:08,240 --> 00:13:12,759
Et ça, ça permet d'entraîner les systèmes à base de raison de neurones

248
00:13:12,759 --> 00:13:16,240
qui vont nous localiser nos symboles musicaux dans les portées.

249
00:13:16,240 --> 00:13:22,879
C'est là où, malgré tout, les approches à base de règles sont intéressantes aussi

250
00:13:22,879 --> 00:13:26,600
parce que la règle qui dit une portée s'incline les unes en dessous des autres,

251
00:13:26,600 --> 00:13:30,080
j'ai pas besoin d'exemples à noter pour dire ça, d'accord ?

252
00:13:30,080 --> 00:13:35,679
Mais on est un petit peu des ovnis à l'équipe Shadoc de l'IRISA à Rennes

253
00:13:35,679 --> 00:13:40,639
parce qu'on fait partie des rares équipes à utiliser aussi les règles,

254
00:13:40,639 --> 00:13:42,679
c'est d'ailleurs notre originalité,

255
00:13:42,679 --> 00:13:46,399
puisqu'on cherche à coupler des règles qui décrivent le contenu

256
00:13:46,399 --> 00:13:48,679
avec des systèmes de reconnaissance.

257
00:13:48,679 --> 00:13:51,759
Le gros avantage des règles, c'est qu'on n'a pas besoin de donner à noter.

258
00:13:51,759 --> 00:13:55,679
Et pourquoi, d'après vous, vous êtes des ovnis à utiliser cette méthode-là ?

259
00:13:55,679 --> 00:13:58,279
Pourquoi c'est pas une méthode démocratisée ?

260
00:13:58,279 --> 00:14:02,679
Eh bien parce que le deep learning marche bien dans 95% des cas.

261
00:14:02,679 --> 00:14:04,679
Nous, on est là pour faire de la recherche,

262
00:14:04,679 --> 00:14:08,519
c'est-à-dire essayer de pousser un petit peu les connaissances

263
00:14:08,519 --> 00:14:10,799
sur des problèmes plus compliqués.

264
00:14:10,799 --> 00:14:15,279
La reconnaissance d'écriture dans des registres anciens,

265
00:14:15,279 --> 00:14:18,879
eh ben malheureusement, on n'a pas beaucoup de données à noter sous la main.

266
00:14:18,879 --> 00:14:22,960
C'est-à-dire qu'autant Google, pour entraîner ses modèles,

267
00:14:22,960 --> 00:14:25,399
des images de chats, il en a à l'appel,

268
00:14:25,399 --> 00:14:28,399
il a des quantités immenses de données,

269
00:14:28,399 --> 00:14:31,480
autant des registres anciens avec la transcription

270
00:14:31,480 --> 00:14:34,519
juste à côté de ce qu'est-ce qui est écrit à cet endroit-là,

271
00:14:34,519 --> 00:14:35,799
eh ben il n'y en a pas beaucoup.

272
00:14:35,799 --> 00:14:42,080
Donc, comment on fait lorsqu'on a peu de données à noter sur un domaine précis ?

273
00:14:42,080 --> 00:14:46,279
C'est plus compliqué d'entraîner des gros réseaux de neurones.

274
00:14:46,279 --> 00:14:48,000
Donc, eh bien c'est notre travail de chercheur

275
00:14:48,000 --> 00:14:49,679
d'essayer de trouver des alternatives.

276
00:14:49,679 --> 00:14:52,159
Maintenant, on sait comment apprendre à lire.

277
00:14:52,159 --> 00:14:55,679
On sait qu'elle dispose de bases de données solides et à noter,

278
00:14:55,679 --> 00:14:57,679
mais est-ce que tout cela est suffisant

279
00:14:57,679 --> 00:15:01,960
pour faire confiance au système de reconnaissance de collapse score à 100% ?

280
00:15:01,960 --> 00:15:04,639
Comment la machine nous signale sa certitude ?

281
00:15:04,639 --> 00:15:07,519
Est-ce qu'elle affiche un certain degré de certitude

282
00:15:07,519 --> 00:15:09,600
sur une base de probabilité,

283
00:15:09,600 --> 00:15:12,039
ou est-ce qu'elle procède d'une autre façon ?

284
00:15:12,039 --> 00:15:18,279
C'est possible de faire des systèmes qui prédisent avec un degré de confiance,

285
00:15:18,279 --> 00:15:23,919
et puis on accorde ou pas de l'importance à ce degré de confiance.

286
00:15:23,919 --> 00:15:27,320
Dans notre cas, à partir du moment où notre système nous dit

287
00:15:27,320 --> 00:15:32,000
sur cette page-là j'ai trouvé des notes blanches ici, ici et ici,

288
00:15:32,000 --> 00:15:35,960
ben on prend et après on voit si c'est compatible avec nos règles

289
00:15:35,960 --> 00:15:37,799
qui nous disent qu'une blanche,

290
00:15:37,799 --> 00:15:39,360
il faut quand même qu'elle soit à peu près sur une mesure

291
00:15:39,360 --> 00:15:41,039
et pas n'importe où dans la page.

292
00:15:41,039 --> 00:15:45,519
C'est ce qui nous permet de prendre en compte la sortie.

293
00:15:45,559 --> 00:15:48,799
Mais c'est vrai que quand un système boîte noire nous dit

294
00:15:48,799 --> 00:15:50,159
« je pense que c'est un chat »,

295
00:15:50,159 --> 00:15:53,919
ben tu penses t'en es sûr, tu penses à 80%,

296
00:15:53,919 --> 00:15:55,960
et c'est là où s'ils pensent à 50%,

297
00:15:55,960 --> 00:15:57,200
alors que nous bien sûr c'est un chat,

298
00:15:57,200 --> 00:15:59,360
on se dit mais pourquoi il n'est sûr qu'à 50% ?

299
00:15:59,360 --> 00:16:02,240
Tout ça pour nuancer la probabilité qui est sortie.

300
00:16:02,240 --> 00:16:05,600
Heureusement, on peut faire des systèmes qui nous indiquent

301
00:16:05,600 --> 00:16:11,879
avec quelle confiance ils pensent qu'ils sont sûrs de leur sortie,

302
00:16:11,879 --> 00:16:14,399
mais ça reste malgré tout une boîte noire,

303
00:16:14,399 --> 00:16:17,000
donc on ne sait pas trop pourquoi elles pensent avec cette probabilité-là.

304
00:16:17,000 --> 00:16:20,480
Les OMR actuelles du commerce,

305
00:16:20,480 --> 00:16:22,240
c'est-à-dire les systèmes actuels dans le commerce

306
00:16:22,240 --> 00:16:24,320
qui sont capables de lire les partitions musicales,

307
00:16:24,320 --> 00:16:25,879
font encore pas mal d'erreurs,

308
00:16:25,879 --> 00:16:28,360
notamment sur de la partition ancienne,

309
00:16:28,360 --> 00:16:30,120
ce qui fait que je ne sais pas si ça vous est déjà arrivé

310
00:16:30,120 --> 00:16:32,039
de prendre une partition et puis de vouloir la scanner

311
00:16:32,039 --> 00:16:35,279
pour avoir le fichier MIDI qui va avec,

312
00:16:35,279 --> 00:16:36,799
ben en fait quand on fait ça,

313
00:16:36,799 --> 00:16:39,480
souvent il y a quand même pas mal d'erreurs,

314
00:16:39,480 --> 00:16:41,679
et ce qui fait que c'est quasiment aussi rapide

315
00:16:41,679 --> 00:16:45,480
de tout retaper dans un logiciel de musique les notes une à une

316
00:16:45,480 --> 00:16:48,879
plutôt que de chercher à corriger ce qu'a fait l'OMR du commerce.

317
00:16:48,879 --> 00:16:50,679
Bon, nous notre but, c'est de faire mieux.

318
00:16:50,679 --> 00:16:53,440
Malgré tout, il y a des fois quand la note est effacée

319
00:16:53,440 --> 00:16:56,399
parce qu'on est sur un document ancien sur lequel il y a eu un trou,

320
00:16:56,399 --> 00:16:58,639
on ne va pas pouvoir inventer si c'était un sol ou un si,

321
00:16:58,639 --> 00:17:00,360
si c'était une croche ou si c'était une noire.

322
00:17:00,360 --> 00:17:04,119
Et c'est l'intérêt de notre système d'intégrer des règles.

323
00:17:04,119 --> 00:17:08,160
Par exemple, si on est dans une mesure qui doit avoir quatre temps

324
00:17:08,160 --> 00:17:10,160
et qu'on a trouvé seulement trois noirs,

325
00:17:10,160 --> 00:17:11,960
trois noirs, ça fait trois temps.

326
00:17:11,960 --> 00:17:16,640
Donc là notre système peut lever une question et dire attention ici,

327
00:17:16,640 --> 00:17:18,519
j'ai pas mon compte de temps.

328
00:17:18,519 --> 00:17:20,200
Donc peut-être qu'il faudrait,

329
00:17:20,200 --> 00:17:22,839
ça vaudrait le coup qu'un humain vienne jeter un œil ici

330
00:17:22,839 --> 00:17:24,039
pour dire ce qui va pas.

331
00:17:24,039 --> 00:17:25,440
Et donc c'est l'intérêt de notre système,

332
00:17:25,440 --> 00:17:29,319
c'est qu'on est capable de lever des questions précises,

333
00:17:29,319 --> 00:17:32,720
par exemple en fonction du nombre de temps dans la mesure,

334
00:17:32,720 --> 00:17:35,759
pour dire à l'humain il faut que tu vérifies cette mesure-là

335
00:17:35,759 --> 00:17:37,880
parce que nous on a trouvé quatre temps et demi,

336
00:17:37,880 --> 00:17:39,920
alors qu'on s'attend à en trouver quatre seulement.

337
00:17:39,920 --> 00:17:43,880
Et donc notre but c'est de limiter l'interaction utilisateur

338
00:17:43,880 --> 00:17:46,640
en lui ciblant les points sur lesquels il doit intervenir.

339
00:17:51,869 --> 00:17:54,029
Il y a une chose qui m'a fait tiquer dans cette discussion.

340
00:17:54,029 --> 00:17:56,549
Alex a demandé si on pouvait faire confiance à la machine.

341
00:17:56,549 --> 00:17:59,750
Aurélie, à juste titre, a répondu en me parlant du cas

342
00:17:59,750 --> 00:18:02,910
où la machine prédit une probabilité plus faible

343
00:18:02,910 --> 00:18:05,230
et demande ensuite à l'humain de confirmer les résultats.

344
00:18:05,230 --> 00:18:08,670
Or quand moi je suis devant de chat GPT et je lui pose une question,

345
00:18:08,670 --> 00:18:12,109
je ne vois aucune probabilité associée au tasse qu'il écrit.

346
00:18:12,109 --> 00:18:16,950
Cela signifie pour moi que je n'ai pas fait confiance à chat GPT.

347
00:18:16,950 --> 00:18:18,789
Bon évidemment le discours est plus complexe,

348
00:18:18,789 --> 00:18:22,670
mais cette discussion me rappelle certains travaux de Père Paolo Benanti,

349
00:18:22,670 --> 00:18:25,230
qui en plus d'être un frère franciscain,

350
00:18:25,230 --> 00:18:27,990
est également l'un des plus grands experts de l'éthique de l'IA

351
00:18:27,990 --> 00:18:30,509
et un membre de la commission d'experts de l'Union européenne.

352
00:18:30,509 --> 00:18:35,230
Bon, le Père Benanti soutient que pour avoir une bonne IA dans le futur,

353
00:18:35,230 --> 00:18:38,109
il est nécessaire qu'elle y a communique avec nous.

354
00:18:38,109 --> 00:18:41,150
Ça veut dire qu'elle nous pose des questions, qu'elle établisse un dialogue.

355
00:18:41,150 --> 00:18:45,150
Par exemple, en soulignant toujours les dégradifiabilités de notre travail,

356
00:18:45,150 --> 00:18:47,869
c'est-à-dire nous demandant toujours notre avis.

357
00:18:47,869 --> 00:18:50,789
Or cette incertitude n'est mais semble pas présente

358
00:18:50,789 --> 00:18:55,349
dans la majorité des applications que l'on trouve normalement d'intelligence artificielle.

359
00:18:55,349 --> 00:18:58,150
Mais pour comprendre un peu comment on est arrivé là,

360
00:18:58,150 --> 00:19:01,549
il faut voir aussi d'où vient l'intelligence artificielle.

361
00:19:01,549 --> 00:19:05,109
Car aucune technologie n'est née dans les vides soudainement,

362
00:19:05,109 --> 00:19:10,349
et souvent l'histoire d'une technologie nous aide à comprendre comment on l'utilise aujourd'hui.

363
00:19:10,390 --> 00:19:13,990
Et voyons alors ce qu'Aurelie nous dit sur l'origine de l'IA.

364
00:19:17,589 --> 00:19:21,029
Ça dépend ce qu'on entend par intelligence artificielle.

365
00:19:21,029 --> 00:19:25,349
Si l'intelligence artificielle c'est simplement faire faire par un ordinateur

366
00:19:25,349 --> 00:19:28,029
quelque chose qu'aurait pu penser un humain,

367
00:19:28,029 --> 00:19:34,670
on remonte l'intelligence artificielle à peu près à l'époque des débuts de l'informatique dans les années 1950.

368
00:19:34,710 --> 00:19:43,029
Il y a 15-20 ans, se sont développés vraiment les modèles à base de réseaux de neurones,

369
00:19:43,029 --> 00:19:48,549
c'est-à-dire qui imitent les neurones qu'on a dans notre cerveau pour faire des prédictions.

370
00:19:48,549 --> 00:19:53,910
Le problème des réseaux de neurones c'est effectivement qu'ils ont besoin de grandes quantités de données,

371
00:19:53,910 --> 00:20:00,029
mais aussi de calculateurs puissants pour s'entraîner.

372
00:20:00,029 --> 00:20:03,069
Et c'est vrai que ces 15-20 dernières années,

373
00:20:03,069 --> 00:20:06,349
on a l'essor des modèles à base de réseaux de neurones profonds,

374
00:20:06,349 --> 00:20:13,670
parce qu'on a des données à noter et aussi parce qu'on a des systèmes, des GPU qui peuvent entraîner ces réseaux de neurones.

375
00:20:13,670 --> 00:20:21,589
Il me semble, je me permets, il me semble que les maths en soi, c'est même les années 80 ou même avant,

376
00:20:21,589 --> 00:20:23,269
les perceptrons, des choses comme ça.

377
00:20:23,269 --> 00:20:27,230
Le perceptron ça date quasiment du début des ordinateurs,

378
00:20:27,230 --> 00:20:32,789
enfin vers les années 1960, on commence déjà à mettre en place la notion de neurones.

379
00:20:32,789 --> 00:20:37,990
Et donc ça fait une vingtaine d'années qu'on a pu entraîner des réseaux de neurones plus complexes.

380
00:20:37,990 --> 00:20:42,309
Effectivement, il y a eu ce côté que pour moi ça m'avait un peu interpellé,

381
00:20:42,309 --> 00:20:45,349
ce fait que ces maths sont connus depuis les années 50.

382
00:20:45,349 --> 00:20:48,349
C'est juste qu'on n'avait pas de données et on n'avait pas de puissance de calcul.

383
00:20:48,349 --> 00:20:50,789
Et les moments où on a eu les deux, bam, la révolution est arrivée.

384
00:20:50,789 --> 00:20:54,630
Mais en vrai, c'est des choses que les premières études, oui, c'est très très vieux.

385
00:20:54,630 --> 00:21:01,960
Et l'idée d'imiter les neurones humains est une très belle idée.

386
00:21:01,960 --> 00:21:04,720
Ici, on est sur un projet de recherche publique.

387
00:21:04,720 --> 00:21:08,720
Pourtant, quand vous entendez parler d'IA, c'était souvent les mêmes qui reviennent.

388
00:21:08,720 --> 00:21:12,039
OpenAI, Google, Microsoft et j'en passe.

389
00:21:12,039 --> 00:21:15,240
Alors non, la recherche publique n'a pas ignoré le sujet.

390
00:21:15,240 --> 00:21:19,880
Mais on peut quand même se demander comment naissent ce genre de projet de recherche.

391
00:21:19,880 --> 00:21:25,079
Alors, on est sur un appel à projet de l'Agence nationale de la recherche.

392
00:21:25,079 --> 00:21:29,680
Tous les ans, l'Agence nationale de la recherche ouvre un appel qui s'appelle appel à projet générique

393
00:21:29,680 --> 00:21:35,480
et qui permet de financer des projets de recherche portés par des chercheurs.

394
00:21:35,480 --> 00:21:43,519
En général, l'ANR favorise les projets pluridisciplinaires qui permettent de faire travailler entre elles

395
00:21:43,519 --> 00:21:47,759
plusieurs équipes de recherche sur des thématiques qui peuvent aller ensemble.

396
00:21:47,759 --> 00:21:53,920
Et donc, pour monter ce genre de projet, l'initiative part généralement d'un porteur de projet.

397
00:21:53,920 --> 00:21:57,559
Donc là, en l'occurrence, c'est un collègue du CNAM

398
00:21:57,640 --> 00:22:03,240
qui a vu la possibilité de faire des travaux sur les documents du corpus de Camille Saint-Saens

399
00:22:03,240 --> 00:22:09,000
qui était à la BNF et qui s'est entouré à la fois de spécialistes en musique

400
00:22:09,000 --> 00:22:16,359
et puis à la fois en l'occurrence nous, l'équipe Shadok, sur la reconnaissance de documents entiers.

401
00:22:16,359 --> 00:22:20,160
Est-ce qu'il y aurait une, entre guillemets, suite au projet ?

402
00:22:20,160 --> 00:22:26,920
C'est-à-dire, est-ce qu'on pourrait imaginer que demain le projet prenne une direction générative ?

403
00:22:26,920 --> 00:22:31,880
Par exemple, on pourrait se servir de la base de Collapscore pour générer des partitions

404
00:22:31,880 --> 00:22:36,039
dans le style de ce que Collapscore a récupéré ou...

405
00:22:36,039 --> 00:22:39,480
Je ne sais pas, est-ce qu'il y a une suite éventuelle au projet tel qu'il est ?

406
00:22:39,480 --> 00:22:43,640
Alors, l'aspect génératif, c'est un autre problème.

407
00:22:43,640 --> 00:22:51,279
Et c'est pas du tout le même métier, même si on pourrait envisager que des données extraites

408
00:22:51,279 --> 00:22:55,200
à partir d'images puissent servir à générer, puissent servir de base de données de départ.

409
00:22:55,200 --> 00:23:02,240
Mais hormis les données, il n'y a pas vraiment de logique à vouloir générer forcément des partitions.

410
00:23:02,240 --> 00:23:06,680
La suite du projet, je pense, ce serait de s'attaquer aux partitions manuscrites.

411
00:23:06,680 --> 00:23:11,559
Puisque là, les partitions qu'on traite, ce sont des partitions qui ont été gravées,

412
00:23:11,559 --> 00:23:15,039
des partitions, voilà, je disais, début XXème siècle.

413
00:23:15,039 --> 00:23:20,119
Donc même si elles sont abîmées, elles sont quand même normées dans la manière dont elles sont écrites.

414
00:23:20,119 --> 00:23:25,160
Les manuscrits, eh bien, déjà, il faut réussir à déchiffrer l'aspect manuscrit.

415
00:23:25,440 --> 00:23:30,319
Chaque musicien a sa manière de décrire sa noir, sa blanche et son silence.

416
00:23:30,319 --> 00:23:32,680
Et ça complique la reconnaissance.

417
00:23:32,680 --> 00:23:37,279
Vous dites que vous essayez de faire mieux que les outils actuels dans le commerce.

418
00:23:37,279 --> 00:23:40,160
C'est que j'imagine que vous les aviez un petit peu regardés.

419
00:23:40,160 --> 00:23:42,759
Est-ce que quand on se lance dans la conception d'un tel projet,

420
00:23:42,759 --> 00:23:47,799
on regarde un peu ce qui se fait chez les autres, ce qui existe déjà ?

421
00:23:47,799 --> 00:23:52,160
Alors, l'objectif de travaux de recherche, nécessairement, c'est de faire avancer

422
00:23:52,200 --> 00:23:56,400
ce qu'il y a, les logiciels qu'on peut trouver dans le commerce.

423
00:23:56,400 --> 00:24:03,079
Et si on soumet un projet de recherche, c'est parce qu'on sait que ce qu'il y a dans le commerce ne suffit pas.

424
00:24:03,079 --> 00:24:06,759
Ça fait partie. On en parlait tout à l'heure du montage du projet ANR.

425
00:24:06,759 --> 00:24:12,559
Lorsque les collègues de la BNF se sont dit, c'est intéressant, nous on a un corpus 500.

426
00:24:12,559 --> 00:24:17,119
La première chose qu'ils ont fait, c'est qu'est-ce qui existe et qui nous permettrait de transcrire nos partitions ?

427
00:24:17,119 --> 00:24:19,200
Et là, ils se sont rendus compte que sur de la partition ancienne,

428
00:24:19,200 --> 00:24:21,920
eh bien, en fait, on n'avait pas exactement ce qui faisait l'affaire.

429
00:24:21,920 --> 00:24:23,839
D'où le montage du projet de recherche.

430
00:24:23,839 --> 00:24:28,720
Est-ce que, du coup, la recherche à l'intelligence artificielle marche effectivement comme les autres champs disciplinaires ?

431
00:24:28,720 --> 00:24:35,240
Dans les sens, pendant l'entretien, là, on a dit plusieurs fois, il faut faire mieux, il faut essayer de faire mieux.

432
00:24:35,240 --> 00:24:37,680
Est-ce que, du coup, la recherche à l'intelligence artificielle,

433
00:24:37,680 --> 00:24:41,240
qu'il n'y a pas, par exemple, ailleurs, au moins pas si important,

434
00:24:41,240 --> 00:24:45,279
est très centrée autour de cette sorte de course de compétition, un peu ?

435
00:24:45,279 --> 00:24:48,119
Parce que ça, ce n'est pas dans d'autres domaines de recherche, on n'a pas trop ça.

436
00:24:48,119 --> 00:24:51,599
On a plus le développement de connaissances, etc.

437
00:24:51,599 --> 00:24:56,640
Dans mon domaine de recherche, l'objectif, c'est de reconnaître ce qu'il y a sur des documents.

438
00:24:56,640 --> 00:25:01,039
Donc, bien sûr, notre objectif, c'est de le reconnaître le mieux possible.

439
00:25:01,039 --> 00:25:10,359
Et je travaille en recherche, donc mon objectif, c'est d'apporter une réponse qui soit plus avancée que ce qu'on peut trouver.

440
00:25:10,359 --> 00:25:12,359
C'est l'objectif de la recherche, malgré tout.

441
00:25:12,359 --> 00:25:18,559
Ou alors, si ce n'est pas quelque chose de plus avancé, en tout cas, c'est de s'attaquer à des problèmes plus compliqués.

442
00:25:18,599 --> 00:25:23,039
Par exemple, le fait de travailler sur du document ancien, c'est un problème plus compliqué

443
00:25:23,039 --> 00:25:27,039
que ne peuvent pas encore gérer les systèmes grand public actuel.

444
00:25:27,039 --> 00:25:32,519
Parce qu'il y a une chose qui m'avait marqué, c'était toujours ce côté de dire qu'il y a des tâches bien définies.

445
00:25:32,519 --> 00:25:38,920
Par exemple, la reconnaissance des partitions et qui, sur Internet, on peut trouver les résultats des autres aussi, effectivement.

446
00:25:38,920 --> 00:25:44,359
Et il y a un peu ce côté de dire que mon travail marche si je suis meilleur que les autres.

447
00:25:44,359 --> 00:25:46,759
Et ça, dans d'autres domaines de recherche, je ne l'avais jamais vu.

448
00:25:46,960 --> 00:25:52,359
Autant formaliser vraiment, de dire qu'il faut tester sur ces données, ces tâches-là.

449
00:25:52,359 --> 00:25:54,400
Si tu arrives à être mieux, t'es bon.

450
00:25:54,400 --> 00:25:58,319
Oui, ça fait partie de manière d'évaluer notre travail de reconnaissance de documents.

451
00:25:58,319 --> 00:26:00,599
C'est-à-dire qu'on a fréquemment des compétitions.

452
00:26:00,599 --> 00:26:05,319
Et pas seulement depuis les réseaux de neurones, il y a dix ans, depuis longtemps.

453
00:26:05,319 --> 00:26:08,519
Il y a des compétitions de reconnaissance de documents.

454
00:26:08,519 --> 00:26:12,920
Par exemple, apprendre à localiser les lignes dans une image de document.

455
00:26:12,920 --> 00:26:18,839
On va faire une compétition pour savoir quelle est la méthode qui reconnaît le mieux les lignes de texte.

456
00:26:18,839 --> 00:26:21,160
Mais en fait, c'est ce qui sert à faire avancer la recherche.

457
00:26:21,160 --> 00:26:28,119
Parce que si on a une méthode qui reconnaît pas mal, mais que celle du voisin reconnaît mieux,

458
00:26:28,119 --> 00:26:31,400
ben autant partir sur la méthode qui reconnaît le mieux.

459
00:26:31,400 --> 00:26:36,720
Ça sert à rien de s'handicaper avec une méthode qui reconnaît moyennement.

460
00:26:36,720 --> 00:26:39,759
Ça fait maintenant un moment qu'on parle d'IA avec Aurélie.

461
00:26:39,759 --> 00:26:42,799
Mais on en parle surtout en tant qu'objet de recherche.

462
00:26:42,799 --> 00:26:48,559
Et quelque part, j'ai l'impression qu'on n'a pas assez interrogé l'intelligence artificielle en tant qu'outil.

463
00:26:48,559 --> 00:26:52,160
Ben oui, la majeure partie du temps, quand on parle d'IA au quotidien,

464
00:26:52,160 --> 00:26:55,839
on parle de quelque chose de pratique, de facilitant dans la vie de tous les jours.

465
00:26:55,839 --> 00:26:57,839
Alors je lui pose une question un peu méta.

466
00:26:57,839 --> 00:27:04,000
Est-ce que l'IA, en plus d'être un objet de recherche, peut-être un outil au service de la recherche ?

467
00:27:04,000 --> 00:27:09,119
Pour moi, l'intelligence artificielle est déjà un outil de mes recherches.

468
00:27:09,279 --> 00:27:16,480
Effectivement, on a plusieurs manières d'aborder l'intelligence artificielle.

469
00:27:16,480 --> 00:27:21,200
J'ai par exemple un doctorant qui va soutenir très prochainement,

470
00:27:21,200 --> 00:27:28,000
qui a travaillé à produire un système de réseau de neurones qui soit capable de s'entraîner avec peu de données.

471
00:27:28,000 --> 00:27:34,079
Et dans son cas, la production du réseau de neurones était un objet de ses recherches.

472
00:27:34,079 --> 00:27:38,279
Dans le cas de mes recherches sur la reconnaissance de partition musicale,

473
00:27:38,279 --> 00:27:44,440
je vois plus le réseau de neurones comme un outil pour m'aider à décrire mon système.

474
00:27:44,440 --> 00:27:48,839
Mon système qui est en soi un objet de reconnaissance artistique.

475
00:27:48,839 --> 00:27:53,880
Mon système qui est en soi un système d'intelligence artificielle.

476
00:27:53,880 --> 00:27:56,599
Oui, pour toi c'est et un outil et l'objet.

477
00:27:56,599 --> 00:27:59,000
Voilà, pour moi c'est et un outil et un objet.

478
00:27:59,000 --> 00:28:03,519
Je pense que malgré tout, dans un champ disciplinaire comme les humanités numériques,

479
00:28:03,519 --> 00:28:08,880
les travaux qu'on fait nous en intelligence artificielle peuvent devenir un outil fantastique

480
00:28:08,880 --> 00:28:11,759
pour faire de l'analyse de corpus à large échelle.

481
00:28:11,759 --> 00:28:17,880
On en parlait tout à l'heure pour les collègues musicologues qui vont pouvoir détecter des patternes avec ce qu'on reconnaît.

482
00:28:17,880 --> 00:28:23,720
Pour eux, l'intelligence artificielle va être un outil pour découvrir de nouvelles choses, de nouveaux motifs, etc.

483
00:28:26,400 --> 00:28:31,440
On aurait pu échanger encore longtemps sur le sujet de l'intelligence artificielle dans la recherche,

484
00:28:31,440 --> 00:28:32,680
tant il y a à dire.

485
00:28:32,720 --> 00:28:38,720
Néanmoins, on est très heureux d'avoir pu échanger avec Aurélie Lemaitre, chercheuse sur le projet Collapscore.

486
00:28:38,720 --> 00:28:41,319
Un grand merci à elle pour nous avoir accordé cet entretien.

487
00:28:41,319 --> 00:28:46,279
Si cet épisode vous a plu et que vous l'écoutez en podcast, n'hésitez pas à nous laisser un commentaire.

488
00:28:46,279 --> 00:28:51,000
On vous rappelle que toutes nos précédentes émissions sont disponibles sur toutes les plateformes de podcast.

489
00:28:51,000 --> 00:28:54,640
A bientôt sur Silab ou en podcast pour un nouvel épisode d'Azerty !

490
00:28:56,119 --> 00:29:03,799
J'aime bien venir ici, parce que le wifi va super vite. Il n'y a pas beaucoup d'endroits comme ça qui offre une connexion fibre avec une vitesse gigabite. Sous-titres générés avec IA (Whisper), editing et proofing par Guglielmo Fernandez Garcia.