Showing posts with label microsoft. Show all posts
Showing posts with label microsoft. Show all posts

Saturday, January 17, 2026

Après les moteur de recherche par indexation en 1993, l’apprentissage profond 2012, puis les chatbots ChatGPT Gemini, 2022, la troisième AI intègre le monde réel. Des chercheurs suggèrent que Gemini est en train de détrôner tous ses concurrents

 

Pour souhaiter un "Pace e salute" en ce début d'année 2026,
voici un post sur mon vieux blog.

Geoffrey Hinton reçoit avec Yoshua Bengio et Yann Le Cun le prix Turing 2018 pour leurs travaux sur l'apprentissage profond. Ils sont appelés les « pères fondateurs » de l'intelligence artificielle.

Yann Lecun, Yoshua Bengio, Geoffrey Hinton. Deep learning. Nature, 2015, 521 (7553), pp.436-444.
  • Geoffrey Hinton, né le 6 décembre 1947 à Wimbledon (Royaume-Uni), est un chercheur britanno-canadien. Il est co-auteur d'un article publié en 1986, qui a popularisé l'algorithme de rétropropagation pour l'entraînement des réseaux de neurones-perceptrons multicouches: Learning representations by back-propagating errors https://www.nature.com/articles/323533a0
  • Yoshua Bengio, né le 5 mars 1964 à Paris en France, est un chercheur québécois-canadien d'origine franco-marocaine. Il est le seul scientifique vivant à avoir dépassé le million de citations sur Google Scholar. Il rejoint ainsi Michel Foucault, philosophe, historien des idées et militant politique français, cité plus d’un million de fois par ses pairs.
  • Yann Le Cun, né le 8 juillet 1960 à Soisy-sous-Montmorency en France. -Il estime que les LLM (de l'anglais Large Language Model) actuels sont limités car ne « comprenant » pas réellement le monde ; il juge les architectures JEPA plus prometteuses, car capables de construire des représentations internes du monde et de prédire ses évolutions.
On constate combien l'esprit révolutionnaire français est présent dans les fondements et développements de l'AI. 

Un petit clin d'oeil historique

Marseille est l’un des berceaux de l’intelligence artificielle en France avec la création du langage Prolog au début des années 1970. L’objet de cet article est de donner quelques repères historiques et de rendre hommage à Alain Colmerauer ainsi qu’aux membres de son équipe, aux chercheurs et enseignants-chercheurs qui ont contribué au développement de la recherche, de la formation et du transfert technologique en intelligence artificielle à partir de Marseille.

Geoffrey Hinton: Trois ans après avoir été pris au dépourvu par ChatGPT, Gemini est-il en train de gagner ?

Alors que la compétition autour de l’intelligence artificielle générative est souvent racontée comme une succession de coups médiatiques, de démonstrations spectaculaires et d’annonces parfois précipitées, Google avance à un rythme plus feutré. Avec Gemini, son modèle d’IA unifié, le groupe semble aujourd’hui récolter les fruits d’une stratégie plus structurelle que narrative. Sans déclarer officiellement la victoire, Google apparaît de plus en plus comme un acteur central, voire dominant, dans la phase actuelle de la course à l’IA. C'est en tout cas l'avis de certains spécialistes comme Geoffrey Hinton, le « parrain de l'IA ».

Depuis la fin de l’année 2022, la course à l’IA générative a été largement perçue comme un duel entre nouveaux entrants spectaculaires et géants historiques pris de court. L’irruption de OpenAI a imposé un nouveau tempo, rapidement suivi par l’intégration agressive de modèles génératifs dans les produits de Microsoft. Dans ce contexte, Google a souvent été décrit comme hésitant, voire en retard, malgré des années de recherche fondamentale en apprentissage automatique et en réseaux neuronaux.

Pendant une grande partie de l’année 2023, Google a souffert d’une image de poursuivant. L’arrivée rapide de modèles conversationnels très populaires a donné l’impression que le géant de Mountain View avait perdu l’initiative, malgré son rôle historique dans la recherche en apprentissage profond. Cette lecture, largement façonnée par le calendrier médiatique, a progressivement perdu de sa pertinence à mesure que la stratégie de Google s’est clarifiée.

Google a connu quelques lancements de produits difficiles par le passé. En 2024, Google a dû arrêter son générateur d'images IA parce que les gens disaient qu'il créait des images historiquement incorrectes de personnes de couleur et qualifiaient les résultats de « trop politiquement corrects ». Google a rapidement présenté ses excuses pour ce qu’il décrit comme des « inexactitudes dans certaines représentations historiques générées par l’image » avec son outil Gemini, en disant que ses tentatives de créer une « large gamme » de résultats ont manqué la cible. Gemini est un outil d’intelligence artificielle lancé par Google qui peut créer des images en réponse à des requêtes écrites. 

« Nous sommes conscients que Gemini propose des inexactitudes dans certaines représentations de génération d'images historiques », regrette Google dans sa déclaration publiée sur X/Twitter. « Nous travaillons à l'amélioration immédiate de ce type de représentations. La génération d'images par l'IA de Gemini génère un large éventail de personnes. Et c'est généralement une bonne chose, car des gens du monde entier l'utilisent. Mais dans le cas présent, il n'y a pas d'adéquation ». Après avoir mis l'outil en pause, le temps de retravailler dessus, il a été relancé.

Les versions précédentes de son outil de recherche IA donnaient également des conseils étranges, comme dire aux utilisateurs de mettre de la colle sur leur pizza pour empêcher le fromage de glisser.

Auparavant, le PDG de l'entreprise, Sundar Pichai, avait même déclaré que l'entreprise avait attendu pour lancer son chatbot parce qu'il n'était pas prêt. « Nous n'avions pas encore atteint un niveau où nous pouvions le commercialiser et où les gens auraient accepté que Google lance ce produit. Il présentait encore beaucoup de problèmes à l'époque », a déclaré Pichai.

Le lancement et l’évolution de Gemini ont marqué un changement de rythme. Là où les premières réponses de Google semblaient défensives, la firme a progressivement déployé un modèle plus cohérent, mieux intégré et techniquement plus ambitieux. Ce basculement n’a pas été immédiat, mais il s’est opéré de manière continue, presque imperceptible pour le grand public.

Gemini 3, le LLM qui change la donne ?

En novembre 2025, Google a annoncé Gemini 3, un modèle d'intelligence artificielle amélioré, près de huit mois après le lancement de Gemini 2.5. La société a déclaré que sa dernière suite de modèles d'IA exigera des utilisateurs qu'ils fournissent « moins d'indications » pour obtenir les résultats souhaités. Google a également annoncé une nouvelle plateforme d'agents appelée « Google Antigravity », qui permet aux développeurs de coder « à un niveau supérieur, axé sur les tâches ».

À la suite de cette annonce, Geoffrey Hinton, le « parrain de l'IA », a récemment estimé que Google est en train de rattraper OpenAI dans la course à l'intelligence artificielle (IA) [voir ci-dessous].Hinton, professeur émérite à l'université de Toronto et ancien expert de Google Brain, s'est également dit surpris que Google ait mis autant de temps à dépasser ses concurrents. Dans une interview accordée à Business Insider, lorsqu'il a été question de la position de Google par rapport à OpenAI, Hinton a déclaré : « Je pense qu'il est en fait plus surprenant que Google ait mis autant de temps à dépasser OpenAI. Je pense qu'à l'heure actuelle, ils commencent à le dépasser ».

Cette déclaration fait suite au lancement très apprécié de Gemini 3 de Google, une mise à jour qui, selon de nombreux acteurs du monde technologique, a permis à l'entreprise de dépasser le GPT-5 d'OpenAI. Le modèle d'image Nano Banana Pro AI de Google a également connu un grand succès. Ce changement intervient trois ans après que Google aurait déclaré « code rouge » à la suite de la sortie initiale de ChatGPT, des rapports récents suggérant désormais que c'est OpenAI qui pourrait tirer la sonnette d'alarme.

Geoffrey Hinton affirme que Google dispose d'un avantage en matière de puces IA. Outre le lancement réussi de son tout dernier modèle d'IA, le cours de l'action Google a augmenté après que des rapports ont suggéré que l'entreprise pourrait conclure un accord d'un milliard de dollars pour fournir à Meta, la société mère de Facebook, ses propres puces IA. La création de ses propres puces est un « avantage considérable » pour Google, a fait remarquer Hinton. Il a déclaré : « Google dispose de nombreux chercheurs très compétents et, bien sûr, d'une grande quantité de données et de nombreux centres de données. Je pense que Google va gagner. »

Gemini, un modèle pensé comme une plateforme

Avec Gemini, Google n’a pas cherché à empiler un énième modèle conversationnel, mais à concevoir une architecture unifiée capable de traiter nativement texte, image, audio, vidéo et code. Contrairement à des modèles conçus initialement pour le texte puis étendus par couches successives, Gemini a été pensé dès l’origine comme multimodal [il a été entraine en meme temps sur tous les types de données et non sur langage puis img puis video avec ajout de plug-in].

Ce choix technique a des implications concrètes. Il permet une meilleure cohérence entre les différents types de données, une réduction des pertes d’information entre modules et une plus grande efficacité lors de tâches complexes combinant raisonnement, compréhension visuelle et génération de contenu. Dans les benchmarks académiques comme dans de nombreux tests internes, certaines versions de Gemini ont commencé à dépasser ou à égaler leurs concurrents directs sur des tâches de raisonnement avancé.

Une intégration silencieuse mais massive dans l’écosystème Google

L’un des atouts majeurs de Google réside dans son écosystème existant. Gemini n’est pas seulement un produit autonome : il est progressivement injecté dans la recherche, les outils bureautiques, le développement logiciel, la gestion des données et les services cloud. Cette diffusion progressive, souvent peu spectaculaire, contraste avec des lancements plus bruyants mais confère à Google un avantage structurel.

Là où certains acteurs doivent convaincre les utilisateurs d’adopter de nouveaux outils, Google intègre Gemini dans des usages quotidiens déjà installés. Cette approche limite les frictions, permet une collecte de retours à grande échelle et accélère l’itération des modèles dans des conditions réelles.

Des moyens industriels difficiles à égaler

Sur le plan purement industriel, Google dispose d’un avantage rarement mis en avant dans les débats publics : sa maîtrise de l’infrastructure. Entre ses centres de données, ses accélérateurs maison et son expérience dans l’optimisation à grande échelle, le groupe peut entraîner, déployer et ajuster des modèles de très grande taille sans dépendre entièrement de fournisseurs externes.

Cette autonomie réduit les coûts marginaux, sécurise les chaînes d’approvisionnement en calcul et offre une flexibilité stratégique importante à long terme. Dans une course où l’accès à la puissance de calcul devient un facteur déterminant, cet élément pèse lourdement.

Un facteur important pour Gemini 3 était la manière dont il a été entraîné : à l'aide des TPU de Google, une puce hautement spécialisée que l'entreprise développe depuis des années précisément dans ce but. Google est certes sensible à certains problèmes de fabrication et à la hausse des prix de la RAM, comme tout le monde, mais contrairement à la quasi-totalité de ses concurrents, il ne dépend pas de la chaîne d'approvisionnement de Nvidia. Google est en mesure d'optimiser l'ensemble de son système pour le rendre meilleur, plus rapide et moins cher. Personne d'autre ne dispose d'un tel contrôle complet sur son destin en matière d'IA.

Gemini va équiper la prochaine version de Siri, permettant à Apple de transformer son assistant IA

Que faire lorsque l'on dispose de la technologie nécessaire ? La présenter au public et la mettre en œuvre. Lundi, Google et Apple ont annoncé que Gemini équiperait la prochaine génération de Siri, qui sortira plus tard cette année. C'est une grande victoire pour Apple, qui dépenserait 1 milliard de dollars par an dans l'espoir de transformer Siri en un assistant IA réellement utile, pour une fois.

Pour Google, c'est tout aussi important. Le fait qu'Apple affirme qu'il s'agit de « la meilleure technologie disponible » est évidemment un signal fort pour le marché, mais plus encore, Siri devient immédiatement l'un des moyens les plus populaires d'interagir avec Gemini.

[B]Sortie de « Personnal Intelligence..

----------

Geoffrey Hinton, le « parrain de l'IA », affirme que Google « commence à dépasser » OpenAI.

En novembre 2025, Google a annoncé Gemini 3, un modèle d'intelligence artificielle amélioré, près de huit mois après le lancement de Gemini 2.5. À la suite de cette annonce, Geoffrey Hinton, le « parrain de l'IA », a récemment estimé que Google est en train de rattraper OpenAI dans la course à l'intelligence artificielle (IA). Hinton, professeur émérite à l'université de Toronto et ancien expert de Google Brain, s'est également dit surpris que Google ait mis autant de temps à dépasser ses concurrents. Dans une interview accordée à Business Insider, lorsqu'il a été question de la position de Google par rapport à OpenAI, Hinton a déclaré : « Je pense qu'il est en fait plus surprenant que Google ait mis autant de temps à dépasser OpenAI. Je pense qu'à l'heure actuelle, ils commencent à le dépasser ».

Hinton, qui a contribué au développement des premières recherches en IA lorsqu'il travaillait chez Google Brain, a déclaré que la société de recherche était autrefois leader dans le domaine de l'IA, mais qu'elle avait choisi de se retenir. « Google a longtemps été en tête, n'est-ce pas ? Google a inventé les transformateurs. Google disposait de chatbots performants avant tout le monde », a souligné Hinton.

Cependant, Google s'est montré prudent après l'échec en 2016 du lancement par Microsoft de son chatbot IA « Tay », qui a connu une existence éphémère, la société ayant décidé de le fermer après qu'il ait publié des tweets extrêmement racistes, a expliqué Hinton. « Google, qui jouissait évidemment d'une très bonne réputation, craignait de la voir ternie de cette manière », a ajouté Hinton.

Google a connu quelques lancements de produits difficiles par le passé. L'année dernière, il a dû arrêter son générateur d'images IA parce que les gens disaient qu'il créait des images historiquement incorrectes de personnes de couleur et qualifiaient les résultats de « trop politiquement corrects ». Les versions précédentes de son outil de recherche IA donnaient également des conseils étranges, comme dire aux utilisateurs de mettre de la colle sur leur pizza pour empêcher le fromage de glisser.

Google fait également un don de 10 millions de dollars canadiens pour aider à financer la chaire Hinton en intelligence artificielle à l'université de Toronto, et l'université versera une somme équivalente. Hinton, qui a quitté Google en 2023 en raison de ses inquiétudes concernant les risques liés à l'IA, s'est depuis exprimé publiquement sur les dangers tels que la perte d'emplois et le fait que l'IA pourrait dépasser l'intelligence humaine. En 2024, il a même reçu le prix Nobel de physique.

Dans un communiqué, l'entreprise a déclaré : « Les travaux de Geoff sur les réseaux neuronaux, menés pendant ses années universitaires et sa décennie chez Google, ont jeté les bases de l'IA moderne. Cette chaire rend hommage à son héritage et aidera l'université à recruter des chercheurs visionnaires qui se consacreront au même type de recherche fondamentale motivée par la curiosité que Geoff a défendue. »

Les déclarations de Hinton interviennent alors qu'un rapport a récemment révélé qu'OpenAI aurait besoin de lever au moins 207 milliards de dollars d’ici 2030 pour poursuivre sa trajectoire actuelle, selon des projections de l'équipe américaine de HSBC chargée des logiciels et des services, relayées dans la presse économique. À l’échelle du secteur technologique, ce chiffre frôle l’irréel. Pourtant, il reflète une réalité devenue incontournable : l’intelligence artificielle moderne coûte une fortune monumentale, et chaque nouveau palier technologique transforme cette facture en précipice.

Geoffrey Hinton, parrain de l'IA, affirme que les géants de la technologie ne peuvent tirer profit de leurs investissements astronomiques que si la main-d'œuvre humaine est remplacée

 Les actions Nvidia chutent de 4 % après l'annonce que Meta utilisera les unités de traitement de tenseur (TPU) de Google, une puce spécialisée hautement efficace pour l'IA, dans ses centres de données en 2027

 L'avance d'OpenAI sur les autres entreprises d'IA a largement disparu après la sortie de Claude d'Anthropic, Gemini de Google, Grok de X, ainsi que Llama de Meta, selon un rapport sur l'état de l'IA

Source : Interview de Geoffrey Hinton accordée à Business Insider

Entrevue avec Yoshua Bengio par Les Sceptiques du Québec

On y explore les promesses et les pièges de la révolution en cours. Ce dimanche, le chercheur montréalais Yoshua Bengio parle avec notre chroniqueur de ses regrets, mais aussi de son espoir de rendre un jour les systèmes d’IA plus sûrs.
On va devoir bientôt développer la psychorobotique telle qu'imaginée par Asimov. Et, peut-être, s'inspirer de ses lois de la robotique:
"Alors que les prochaines décennies vont voir les avancées de l’IA et de la robotique, quelles barrières ou mesures juridiques mettre en place pour s’assurer que ces entités ne fassent pas de mal aux humains ? En 1942, l’écrivain américain d’origine russe Isaac Asimov (1920-1992) a présenté ses célèbres Trois lois de la robotique dans une nouvelle intitulée Cercle vicieux (Runaround) – ou Cycle fermé – qui met en scène les interactions d’un robot intelligent avec les humains. Les Trois lois sont les suivantes : (1) un robot ne peut porter atteinte à un être humain, ni, en restant passif, permettre qu’un être humain soit exposé au danger ; (2) un robot doit obéir aux ordres qui lui sont donnés par un être humain, sauf si de tels ordres entrent en conflit avec la première loi ; (3) un robot doit protéger son existence tant que cette protection n’entre pas en conflit avec la première ou la deuxième loi. Par la suite, Asimov a écrit beaucoup d’histoires montrant les conséquences inattendues que pouvaient avoir ces trois lois simples.
Plus tard, il ajouta une autre loi : « un robot ne peut pas faire de mal à l’humanité, ni, par son inaction, permettre que l’humanité soit blessée. » Ces lois ont influencé non seulement les auteurs de science-fiction, mais aussi les experts en intelligence artificielle. Après avoir découvert les lois d’Asimov, le chercheur en IA Marvin Minsky (1927-2016) indiqua qu’il « ne cessa jamais de s’interroger sur la manière dont pouvaient fonctionner les esprits…" 

Yann Le Cun, le 15 janvier 2026 : « Pourquoi je quitte Meta pour créer ma start-up d’IA »

Avec journalistes "le monde"

L’ex-directeur de la recherche fondamentale en intelligence artificielle de Meta justifie le lancement de sa start-up, spécialisée dans le monde physique, par ses divergences avec le groupe américain, et prédit une « troisième révolution de l’IA ».
A 65 ans, Yann Le Cun, le ponte de l’intelligence artificielle (IA) aux yeux clairs pétillants derrière ses éternelles lunettes Ray-Ban Wayfarer, veut ouvrir un nouveau chapitre de sa vie. Après avoir posé, comme chercheur, les bases de l’IA moderne – ce qui lui a valu de recevoir le prestigieux prix Turing 2018, avec deux confrères, Yoshua Bengio et Geoffrey Hinton –, puis dirigé pendant plus de douze ans la recherche fondamentale en IA chez Meta, le Français lance sa start-up, baptisée « AMI », pour Advanced Machine Intelligence, qu’il rêve en « entreprise mondiale ».

Il réserve les détails de sa levée de fonds (estimée à 500 millions d’euros) et le casting de son équipe à des annonces courant février. On sait seulement que son siège sera à Paris et qu’il a déjà enrôlé l’ex-directeur de Meta France Laurent Solly, ainsi qu’Alex LeBrun, fondateur de la start-up d’IA spécialisée dans la santé Nabla. L’entrepreneur, installé en partie à New York, ambitionne qu’AMI contribue à ouvrir une nouvelle phase de l’IA : « Après l’apprentissage profond il y a douze ans, puis l’avènement des chatbots comme ChatGPT ou Gemini, il y a trois ans, il va y avoir une troisième révolution : celle des IA qui comprennent le monde réel, le monde physique », a-t-il assuré, jeudi 15 janvier, lors d’une rencontre à Paris avec quelques journalistes, promettant des applications dans l’industrie ou la robotique. Le chercheur ne cache pas que son départ de Meta est lié à des désaccords stratégiques.

Autre entrevue le 13 janvier 2026

C’est au restaurant étoilé Pavyllon, à deux pas du Grand Palais parisien, que Yann LeCun s’est confié au Financial Times dans le cadre de sa série « Lunch with the FT ».

Attablé pour un déjeuner de trois heures et demie, le chercheur français de 64 ans a expliqué sans détour pourquoi il a décidé de quitter Meta après onze ans de bons et loyaux services. « Rester est devenu politiquement difficile », confie-t-il. Une litote pour décrire une rupture qui révèle les tensions croissantes au sein du groupe californien sur la direction à prendre en matière d’IA.

LLM : un modèle en fin de course

Au cœur du conflit : une divergence fondamentale sur l’avenir technologique de l’intelligence artificielle. LeCun, prix Turing et figure tutélaire du deep learning, ne croit pas aux grands modèles de langage comme voie vers la super-intelligence. Pour lui, les LLM sont utiles mais limités, contraints par le langage seul. Une conviction qui détonne dans une Silicon Valley obsédée par cette approche.

Lire aussi : IA générative : Wikipedia fait enfin passer les chatbots à la caisse
Le problème ? Meta vient justement de miser massivement sur cette technologie. Après le lancement de ChatGPT fin 2022, l’entreprise a réorganisé ses équipes autour de Llama, son propre modèle de langage.

Le tournant s’opère véritablement en 2025. Mark Zuckerberg, déçu par les performances de Llama 4, décide de frapper fort. Il investit 15 milliards $ dans Scale AI et embauche son patron, Alexandr Wang, 28 ans, pour diriger le nouveau laboratoire de recherche TBD Lab. Une décision qui place ce jeune entrepreneur à la tête de l’unité de recherche en IA de Meta. Ses nouvelles recrues, attirées à coups de primes pouvant atteindre 100 millions $, sont selon LeCun « complètement convaincues par les LLM ».  LeCun se retrouve ainsi managé par quelqu’un qu’il qualifie de « jeune » et « inexpérimenté ». S’il reconnaît que Alexandr Wang apprend vite, il souligne son manque d’expérience en matière de recherche fondamentale. « On ne dit pas à un chercheur ce qu’il doit faire. On ne dit certainement pas à un chercheur comme moi ce qu’il doit faire », lance-t-il.
La communication se dégrade également avec l'unité IA générative. LeCun regrette que ses équipes proposent des innovations ambitieuses quand la direction ne retient que des projets éprouvés et sans risque. Une prudence qui, selon lui, conduit l'entreprise à prendre du retard.

Une organisation bouleversée

Plus profondément, LeCun refuse de renier ses convictions scientifiques. Certains chez Meta aimeraient qu'il cesse de proclamer publiquement que les LLM constituent une impasse pour atteindre la super-intelligence. Mais le chercheur ne transige pas : « Je ne vais pas changer d'avis parce qu'un type pense que j'ai tort. Je n'ai pas tort. Mon intégrité de scientifique ne me le permet pas. »

Cette inflexibilité s'explique aussi par sa vision alternative : les modèles du monde, ou world models, qu'il développe depuis des années. Cette architecture baptisée V-JEPA vise à donner aux machines une compréhension du monde physique en apprenant à partir de vidéos, et non uniquement du langage. Une approche qui intéresse davantage l'industrie lourde et l'aéronautique que les réseaux sociaux.

Cap vers AMI Labs

LeCun prépare désormais son prochain chapitre : Advanced Machine Intelligence Labs, une start-up qui incarnera sa vision de l'intelligence artificielle avancée. Il y occupera le poste de président exécutif, laissant la direction opérationnelle à Alex LeBrun, cofondateur de la startup française Nabla. Une structure qui lui permettra de conserver la liberté de recherche qu'il chérissait chez Meta. Pourquoi ne doit pas prendre le rôle de CEO ?  « Je suis à la fois trop désorganisé et trop vieux ! » confie Yann LeCun.

Lire aussi : On en sait (un peu) plus sur la future startup de Yann LeCun
Le chercheur promet des premières versions de sa technologie dans les douze mois. Pas encore la super-intelligence, mais un chemin vers celle-ci. Emmanuel Macron lui-même aurait manifesté sa satisfaction de voir cette nouvelle entreprise mondiale maintenir des liens étroits avec la France.

Après des décennies passées à façonner l'IA moderne, Yann LeCun entame donc un nouveau cycle. Son ambition ? Augmenter la quantité d'intelligence dans le monde. « L'intelligence, c'est vraiment ce dont nous devrions avoir davantage », affirme-t-il.

 Références

https://intelligence-artificielle.developpez.com/actu/379290/Trois-ans-apres-avoir-ete-pris-au-depourvu-par-ChatGPT-Gemini-est-il-en-train-de-gagner-Des-benchmarsks-et-des-chercheurs-suggerent-que-Gemini-a-ce-qu-il-faut-pour-detroner-OpenAI-et-tous-ses-concurrents/

https://intelligence-artificielle.developpez.com/actu/378248/Geoffrey-Hinton-le-parrain-de-l-IA-affirme-que-Google-commence-a-depasser-OpenAI-Je-pense-que-Google-va-gagner/

https://www.lemonde.fr/economie/article/2026/01/16/yann-le-cun-pourquoi-je-quitte-meta-pour-creer-ma-start-up-d-ia_6662500_3234.html

https://www.silicon.fr/business-1367/yann-lecun-quitte-meta-les-coulisses-dune-rupture-225126

Saturday, December 30, 2017

Deezer ou Spotify ou Google play ou youTube ou Apple Music ou Amazon Musique... ?

Nous parlons d'une industrie: l'industrie musicale et sa partie diffusion.

En premier contrairement à un support physique comme un CD ou vinyle, il n'est pas possible de revendre le morceau ou l'album acheté. Donc cette industrie est encore plus juteuse puisque c'est du "one shot"mais prend le risque de l'auto-diffusion comme l'industrie du livre et des revues.


Le véritable démarrage de l'industrie musik webService-like est la décision industrielle d'Apple qui lance l'iTunes Music Store aux États-Unis, dont le catalogue inclut des répertoires des cinq majors. Chaque morceau y est vendu au tarif unique de 99 cents au format AAC, et chaque album pour 9.99 dollars US (sauf exceptions). Le succès de son baladeur numérique iPod, étroitement intégré au logiciel iTunes, a été une révolution à la Steve, paix à son âme.
https://fr.wikipedia.org/wiki/Magasin_de_musique_en_ligne
https://en.wikipedia.org/wiki/Online_music_store

https://en.wikipedia.org/wiki/Comparison_of_online_music_stores
https://en.wikipedia.org/wiki/Comparison_of_on-demand_music_streaming_services

Bref quoi que soit le mode d'achat (à la chanson, à l'abonnement), on écoute un droit d'un fichier numérique.  En audio, y a x qualités. mais la question est la banque de données fondamentale avant transcodage style bad MP3.
La taille de la banque de données fondamentale est la première grandeur à mutiplier par la croissance du nombre d'utilisateur * nbr d'utilisateur réel*croissance des services:
SoundCloud en a ~125 millions de tracks, puis Deezer avec ~40millions comme TIdal, Apple, Amazon. Spotify en a un peu moins ~30millions mais avec une excellente stratégie par exemple des appli pour objets connectés comme les montres samsung ou des aggrégations.
Microsoft a annoncé le 2 octobre 2017 que les services d'abonnement et d'achat de musiques prendront fin le 31 décembre 2017. Microsoft invite les clients de "Groove music" (et Zune Music ou Xbox Music) à migrer sur Spotify avec lequel il est en partenariat. L'exemple des échecs successifs de Microsoft dans cette industrie souligne combien cette industrie est très difficile.
Mais Spotify a >150millions d'abo ou de compte free, le BEST!
Deezer que 10millions et piétine en 2017. A part un superMegaBuzz mondial, la partie de boule de neige est jouée.

Un très bon article dans Les Echos

La toile regorge de services de streaming musical et il n'est pas toujours facile de faire un choix. François Lévêque, professeur d'économie, tente ici de vous éclairer dans votre réflexion.
Deezer, Spotify, Apple Music, Tidal, Amazon Musique... La liste Wikipedia des plates-formes d'écoute de musique en streaming contient une trentaine de noms. Quel service choisir ? La recommandation de la théorie économique tient en une phrase : choisir celui dont la victoire dans la bataille de la concurrence est anticipée.

Nous sommes en effet de plain-pied dans le monde économique des plates-formes et de ses puissantes externalités de réseau. Vous connaissez, sans doute, ces effets qui avantagent les entreprises aux plus larges clientèles.

Cela se traduit ici de la façon suivante : plus un service de streaming comptera d’abonnés, plus un abonné aura de chances de pouvoir échanger ses listes de lecture et ses avis avec d’autres ; plus appropriées seront les suggestions de titres qui lui seront faites; plus d’artistes et de labels auront intérêt à être présents dans son catalogue. Et, inversement, plus d’artistes et de labels sont présents dans un catalogue, plus il est intéressant d’y être abonné.

Parier sur le bon cheval

D’où des effets boule de neige et une course entre les plates-formes pour recruter le plus de clients des deux côtés de leur marché, et ce le plus vite possible. D’où une marginalisation et une disparition progressive de celles qui n’y parviendront pas. D’où au final un seul ou un petit nombre de vainqueurs. D’où, enfin, l’intérêt de parier sur un bon cheval dès le départ car changer de cheval en cours de route est bien ennuyeux.

Lire aussi :   Pourquoi le jazz et le classique peinent à s’imposer dans le streaming
https://www.lesechos.fr/tech-medias/medias/010160355128-pourquoi-le-jazz-et-le-classique-peinent-a-simposer-dans-le-streaming-2105163.php

Vous subirez en effet des coûts de changement de fournisseur. Non pas qu'il vous en coûtera des espèces sonnantes et trébuchantes, mais il vous faudra apprendre à naviguer sur une autre plate-forme et surtout vous perdrez vos listes de lecture et votre nouveau fournisseur - faute d'historique et des données qui vont avec - ne connaîtra pas vos goûts et ne saura pas au début vous adresser des recommandations et suggestions aussi bien ciblées.

rem perso: avoir toujours 2 fournisseurs.

Plus il y a d'abonnés, mieux c'est

Un autre avantage à la taille, plus classique, s’ajoute à ces effets de réseau : les économies d’échelles. Les données de l’équation économique de base du streaming les feront facilement comprendre. Chaque nouvel abonné contribue aux coûts fixes, c’est-à-dire qui ne varient pas en fonction des ventes, à l’instar des dépenses de développement des algorithmes, interfaces utilisateurs et autres logiciels.

Secundo, chaque nouvel abonné entraîne une augmentation de la redevance à verser aux labels. Elle est de l’ordre de 60% du montant des abonnements. Ainsi un plus grand nombre d’abonnés permet de mieux recouvrer les coûts fixes et donne un plus grand pouvoir de négociation à l’entreprise de streaming pour obtenir des redevances plus faibles.

Notez en passant que la partie de boules de neige coûte cher. A ce jour l’activité de streaming n’est pas rentable. Deezer, Tidal, Spotify et les autres entreprises spécialisées perdent de l’argent. Les Apple Music, Amazon Music et Google Music aussi mais leur déficit est masqué par l’intégration avec les autres activités de leurs opérateurs respectifs.

Procéder par élimination

Commençons à appliquer la recommandation de la théorie économique en procédant par élimination. D’ores et déjà des services de streaming ont pris un tel retard dans le recrutement d’abonnés qu’il est peu probable qu’ils survivront ou alors seulement sur des segments de marché restreints.

Ainsi : évitez SoundCloud, bien mal en point. Ne choisissez pas Anghami sauf si vous êtes fan de musique arabe car son catalogue s’adresse avant tout aux pays du Moyen-Orient et d’Afrique du Nord. Eliminez Tidal, à moins que vous ne soyez un admirateur inconditionnel du rappeur Jay Z qui l’a racheté. N’utilisez TTunes que si vous possédez une Tesla.

Inversement, on peut être presque sûr que certains ne disparaîtront pas. C’est le cas des entreprises multi-produits dont le streaming fait partie. Il attire et fidélise des clients qui consomment d’autres de leurs biens et services. Il n’est donc pas soumis isolément à une contrainte financière et de rentabilité stricte qui limiterait les investissements pour recruter de nouveaux clients et améliorer le service.

Lire aussi :  Soundtrack Business, le Spotify de la musique d’ambiance
https://www.lesechos.fr/tech-medias/medias/030564173660-soundtrack-business-le-spotify-de-la-musique-dambiance-2114813.php#mX6c7Co1IgidP2km.99

C’est bien sûr le cas d’Apple. Pionnière de la vente de musique numérique à la pièce, la firme de Cupertino a pris tardivement le tournant du streaming, sans doute pour cause de cannibalisation. Sa vitesse de rattrapage est cependant spectaculaire. Elle a conquis 20 millions d’abonnés en deux ans. Citons également Amazon qui a lancé sa propre plate-forme musicale et la propose à un tarif réduit à ses meilleurs clients.

La présence durable de ces deux entreprises dans le streaming est d’autant plus certaine qu’il est un maillon indispensable de leurs haut-parleurs Echo et HomePod – vous savez, ces petites enceintes cylindriques connectées censées trôner demain dans tous les salons (ou presque) pour répondre intelligemment (ou presque) à toutes vos questions (ou presque).

Vous pouvez leur demander «Quel temps fera-t-il demain ?» mais aussi «Joue-moi la chanson du jour» ou «Passe le dernier single de Rihanna». Si d’ailleurs vous envisagez l’acquisition d’une telle enceinte connectée, je vous conseille de vous abonner à Amazon Music ou Apple Music pour éviter des problèmes d’incompatibilité. Si vous êtes attaché à ces entreprises mastodontes ou tout simplement trop paresseux pour changer de prestataire, faites le même choix.

Google ou pas Google ?

Le cas de Google est compliqué car l’entreprise joue sur plusieurs tableaux. Elle possède sa propre plate-forme, Google Play Music, accepte Spotify sur son enceinte connectée Google Home, et possède aussi YouTube.

Que vient faire ici la plate-forme de streaming vidéo la plus regardée au monde ? Et bien avec ses 800 millions d’utilisateurs elle est aussi la plus écoutée ! Par ceux qui payent à travers la publicité surtout, et, pour une toute petite partie, à savoir quelques millions seulement, par des abonnés à YouTube Red, sa plate-forme payante qui donne accès à un catalogue de films et séquences vidéo, mais aussi à un catalogue musical. Avec tout juste 7 millions d’abonnés à ses deux services payants, Google a intérêt à les combiner dans une seule offre . Si vous penchez pour Google attendez donc un peu.

Deezer, un avenir en pointillé

Le futur de Deezer est lui aussi difficile à prédire. Cette plate-forme d’origine tricolore domine le marché français. Mais elle ne compte dans le monde entier que 8 millions d’abonnés et sa croissance piétine.

Elle est aujourd’hui majoritairement contrôlée par Len Blatvanik, un magnat anglo-américain d’origine russe dont la holding est présente dans le gaz et le pétrole (EP Energy), le capital-risque (Access Technology), l’immobilier (Grand-Hôtel du Cap Ferrat), et qui détient aussi le contrôle majoritaire de Warner Music Group.

Cette bonne compagnie financière et musicale préserve Deezer d’une sortie du marché à laquelle elle n’aurait pas échappé par manque de moyens. Toutefois son propriétaire pourrait la sacrifier avec ou sans Warner lors d’une prochaine rotation de son portefeuille d’actifs. Mon avis : bof bof, sauf si vous êtes un grand amateur d'artistes français – car Deezer offre un catalogue pointu en la matière – ou si tous vos amis et proches sont déjà abonnés à cette plate-forme.

Spotify est-il vraiment le bon choix ?

Finalement, pourquoi ne pas choisir Spotify ? Même si elle est talonnée par Apple, l’entreprise suédoise n’est-elle pas la première du marché en nombre d’abonnés ? Oui, mais justement elle est talonnée par Apple. Une comparaison financière résume le déséquilibre des forces en présence : en une journée l’entreprise californienne réalise un profit qui équivaut à la perte qu’essuie Spotify sur une année.

Malgré sa taille Spotify perd encore en effet de l’argent. Apple n’est pas en reste mais même en supposant que la perte d’Apple Music soit deux fois plus élevée que celle de Spotify, elle serait épongée en deux jours par les profits des autres activités de la firme.

La question de savoir si Spotify peut être rentable dans le futur agite le monde financier car la firme suédoise s’apprête à entrer en Bourse. Les pronostics sont contrastés. Lui faut-il atteindre 100 millions d’abonnés pour être à l’équilibre ? Obtenir un taux de redevance auprès des labels de 58 ou de 55%  de ses recettes ? Y parviendra-t-elle ?

Ces incertitudes ne doivent cependant pas vous dissuader de choisir Spotify. Elle occupe la première place en nombre d’abonnés et en croissance du nombre d’abonnés. C’est donc le choix le plus conforme au raisonnement économique. En outre, son avenir économique est conforté par l’intérêt que lui prêtent les majors de l’industrie du disque.

Sony, Universal et Warner ne souhaitent sans doute pas avoir Amazon, Apple et Google comme uniques clients. Elles sont chacune actionnaires de Spotify et, connaissant ainsi ses comptes, sont susceptibles de lâcher du lest sur leurs montants de redevance en cas de besoin.

La version originale de cet article a été publiée sur The Conversation.

François Lévêque, professeur d'économie et vient de faire paraître "Les habits neufs de la concurrence" chez Odile Jacob. Il est lui-même abonné à une plate-forme de streaming, mais il n’en a choisi aucune de celles citées. 

Ref

 https://www.lesechos.fr/idees-debats/cercle/cercle-173806-deezer-apple-musique-spotify-amazon-music-lequel-choisir-2115745.php

Sunday, July 23, 2017

screenshot & OCR & copy paste google books & comparison converter image to pdf word onenote evernote



This post is in french & english... Sorry.
Désolé ce post est en français et anglais.

L’OCR, sigles de Optical Character Recognition est une technologie conçue pour analyser la structure de l’image du document et puis diviser le document en caractères, tableaux et images et aussi équations (sur une ligne)... Ensuite, le programme peut reconstituer la mise en page et les éléments en un texte modifiable.

Le convertisseur PDF est également capable de transformer un document PDF en Word, Excel ou d’autres formats éditables. Mais ce genre de logiciel ne permet que de changer le format de fichier sans analyser le contenu du texte ou sans extraire les caractères. Autrement dit, après la conversion de PDF, vous recevez quand même un fichier non modifiable contenant des images.

Ici nous intéressons à la rapidité de traitement lorsque l'on fait une copie d'écran d'un site qui protège le texte (produit du texte visualisable en image, ou comme google books ou les livres/articles en streaming).

If you don’t have a scanner, your phone or a camera can be used in place of one. There are a number of apps in the App Store (iOS mac)  android win GNU/linux that “scan” physical documents into clean PDFs using a phone’s camera.
Evernote's Scannable is just one of several apps that allows you to scan documents with your smart phone (see below).

Comparison of OCR softs

https://en.wikipedia.org/wiki/Comparison_of_optical_character_recognition_software

5 best commercial OCR softs

Abby FineReader

v14 windows and only v12 mac 12.1.6 supported macOS 10.12 Sierra (120€)
perpetual licenses
199€ (Convert PDFs and scans; Edit and comment PDFs)
or 299€ (and Compare documents  and Automate conversion 5000pages/month)

FineReader 14 offers new and enhanced features including wide range of PDF editing tools, document comparison feature and even more perceptive OCR for document conversion. Plus, faster performance across the board — from launching app to opening and converting.
PDF editing
Create PDFs from Word, Excel, and other formats
Retain text styles when exporting to Word
Single-line math formulas support
https://www.abbyy.com/en-eu/finereader/whats-new/comparison-charts/

10€ for this small utilities
https://www.abbyy.com/fr-fr/screenshot-reader/
and alternatives http://alternator.link/software/abbyy-screenshot-reader

ABBYY Real-Time Recognition SDK for mobile apps.
Extracting text directly from the smartphone’s preview screen is significantly faster and more convenient than taking a picture of the text followed by an OCR step

ABBYY Mobile Imaging SDK
The toolkit to analyze photos of documents captured with mobile devices to determine whether they are suitable for OCR or enhance their visual quality.

PDFELEMENT

59€
mac/PC
Autre point fort de l’outil, il est capable de rendre les formulaires numérisés modifiables et d’exporter les données numérisées au format CSV.

http://www.leptidigital.fr/technologie/logiciels-ocr-8915/

Omnipage

Omnipage 18 windows XP to 10
99€
educ: 69€

SDK win, linux, mac
http://www.nuance.fr/for-business/by-product/omnipage/for-developers/index.htm
http://www.nuance.fr/for-business/by-product/omnipage/for-developers/csdk-for-mac/index.htm

Readiris

Readiris 16
99€
mac/pc/iOS
OSX 10.9, 10.10,10.11 and 10.12
http://www.irislink.com/EN-US/c1466/Readiris-16-for-Macintosh---OCR-Software.aspx

Create indexed PDF files
This format is identical to the original PDF file except that it adds a layer of indexed text. This means you can easily search for the information you need in a document or a large volume of archived documents.
SDK
http://www.irislink.com/EN-US/c1096/iDRS-15.aspx

Skysoft PDF Editor 6 Professional for Mac or Win

commercial 99€
https://pdf.iskysoft.com/6std-vs-6pro.html

Renee PDF

par un français et gratuit mais que windows et pas open source
https://www.reneelab.fr/product-land-337.html

Ref

https://pdf.wondershare.fr/pdf-editing-tips/pdf-ocr-software.html

Prise de note, de scan, de photo et OCR limité

Greenshot

free soft and open source 
only windows
http://getgreenshot.org/
Greenshot is a light-weight screenshot software tool for Windows with the following key features:

Quickly create screenshots of a selected region, window or fullscreen; you can even capture complete (scrolling) web pages from Internet Explorer.
Easily annotate, highlight or obfuscate parts of the screenshot.
Export the screenshot in various ways: save to file, send to printer, copy to clipboard, attach to e-mail, send Office programs or upload to photo sites like Flickr or Picasa, and others.
...and a lot more options simplyfying creation of and work with screenshots every day.

Being easy to understand and configurable, Greenshot is an efficient tool for project managers, software developers, technical writers, testers and anyone else creating screenshots.

Screenshot to Speech

6€
http://macgenius.co/app/Screenshot-to-Speech/955098738
Poor OCR recognition

picatext

osx 10.12
4€
You need to get the text out of an image or from anywhere on your screen? With picatext this is as easy as selecting a file or a screen area. So now you can get the text you need in almost no time. No need to tediously typewrite everything again.
picatext is OCR made simple. We included just the functionality you need. Nothing that might distract you. That helps focusing on the important things and saves you a lot of time.
These are the awesome features of picatext:
- get text from images
- extract text from your screen
- supports the recognition of over 40 languages
- start screen selection by shortcut
- text gets copied to clipboard automatically
- set the font of the output text
http://www.macdrifter.com/2013/10/picatext-for-image-ocr-on-mac.html

Prizmo

50€
https://computers.tutsplus.com/tutorials/5-ways-to-ocr-documents-on-your-mac--mac-49683
https://creaceed.com/prizmo
https://itunes.apple.com/app/id546392952
Prizmo is a dedicated OCR app. It isn’t designed to help you crop or straighten your scanned documents, it’s sole purpose is to analyse the text of any scans and convert it into searchable text. It’s not just limited to plain text documents such as receipts and correspondence, Prizmo will even analyse old newspapers and magazines, book covers, pretty much anything with any shape, size and colour of text is something Prizmo will convert.
Prizmo includes the ability to capture scans directly from Image Capture, OS X’s built-in camera and scanner import app, so you can use it in conjunction with any existing scanner. You can also import existing files if you’ve been scanning them already.

Skim Clip

very good software.
It's the best for screenshot and built-in OCR.
http://www.domloveskim.com/software/skim-clip/#download
http://kimlovingnews.blogspot.fr/2012/08/skim-clip-11-headed-to-mac-app-store.html (the last post=dec 2012).
https://maczot.com/discuss/2012/11/23/skim-clip1353651425/

oldies dec 2012; shareware 10$. only MAC >10.6. Works on sierra 10.12.
The trial version is limited to 10 minutes of use at a time and has a 10 second delay at start up.

It uses tesseract (which support for a number of new image formats was added using the Leptonica library http://www.leptonica.com/). Leptonica is a pedagogically-oriented open source site containing software that is broadly useful for image processing and image analysis applications.
In addition to the freeform selection, we've added (v 1.1) a few more features such as playing a sound when clipping, an option to remove all headers from the exported output, and the ability to use a script to filter the OCR text before it is saved as a clipping. This last feature, filtering, is particularly interesting because it opens up many work flow possibilities as you may apply your understanding of UNIX and scripting tools like sed (https://en.wikipedia.org/wiki/Sed) and Perl to perform all kinds of creative transformations and processing on the scanned text.
Skim Clip is a unique new utility for OS X that combines Optical Character Recognition (OCR) with screen capture features to create a powerful and convenient new way of saving and organizing your information.
Using Skim Clip, you can capture the contents of any window, scan and save all its text including words in images, and store it into organized categories - all with a single keypress.
With the clipping converted into scanned computer text, you can instantly search thousands of clippings to find what you're looking for. Like a photographic memory with a search engine, Skim Clip makes it easy to keep, find, and reuse anything that's ever on your screen!

Features (v 1.0) include:
* Instantly clip with a single hot key from any application
* Fast and accurate OCR text conversion of any screen
* Scales to easily manage thousands of clippings
* Very quickly search OCR text, notes, and more
* Reuse your clipping by emailing, saving, and pasting them
* Present your clippings with slideshows and quicklook
* Create clipping categories and subcategories
* Export dozens of clippings in a single click
* Browse your clippings as thumbs or a listing
* Get visual feedback and categorize anywhere with the status menu
* Set your own hot key, export style, and more
* Automated custom scanned text processing
* Integrate Skim Clip into your workflow with AppleScript
* Double tap the hot key to instantly add a note for extra convenience
* Elegant interface to help keep your clips organized
* Keep focused on your work with Skim Clip always ready
* Optimized OCR for English with support for other languages

Version 1.1:
Clip anywhere on the screen by holding the clip hot key for freeform selection
Custom filtering of scanned text for advanced processing
Automate clipping with AppleScript
Improved image processing for better accuracy
Sound effect when clipping
Option to remove headers when exporting
Increased mail export compatibility
Plain text...

We've been invited to share the following comments from one Jim Miller, author of the well-regarded Rabbi Hawkins Mystery Series. Here's what Mr. Miller has to say about Skim Clip:
Skim Clip is amazing. I’m usually disappointed by Apps that claim to do everything, including saving the world, and then do nothing at all. That is not the case with Skim Clip. It does exactly what the developer says it will do. It is a screen capture and OCR combo that works.
Another plus for this program is the obvious time and effort that has gone into making the user manual simple and easy to understand. I was able to walk through the step-by-step instructions and capture a variety of screen shots. I do a lot of screen shots with the Mac’s commands, but they all end up as jpegs. With Skim Slip, I get the jpeg and if I choose, I can convert it into text and then insert it into Word, Pages and Scrivener very easily.
This is a timesaver I love. I used to cut and paste a captured image into a word processor or have it up on the screen so that I could then type the content into some other program just to make it useable. Not anymore. With Skim Clip, it’s all done for me.
Many thanks to Dominic and Kimberly,  (DomLovesKim Company)
Jim Miller
http://kimlovingnews.blogspot.fr/2012/10/from-author-using-skim-clip.html

Only for Intel, 64-bit processor, Mac OS X 10.6 or later, 64-bit processor
put the text OCR in the copy-buffer.

I try this soft on MAC 10.12.5 on chrome and others browsers :  it's the fastest.
Some minor pb with OCR when characters are tiny, just expand your window or try increasing your application's font size.
If you want another soft (but also oldies 2013), use PDF OCR X Community Edition (it also uses this Tesseract code) is a simple drag-and-drop utility for Mac OS X and Windows, that converts your PDFs and images into text documents or searchable PDF files. You must save the screenshot to a file (img) and drag-and-drop to it and copy the text. Then Skim Clip is faster and far better.

LEADTOOLS OCR App Review and SDK

iOS and android
https://www.leadtools.com/blog/document-imaging/leadtools-ocr-app-review/

OneNote

use Microsoft OneNote's built-in OCR functionality (free for Windows/Mac) ; it's in Pack Office.

menu
copy img
(right clics) copy picture to text

https://webapps.stackexchange.com/questions/57418/how-can-i-copy-paste-segments-from-google-books
In OneNote, users can enter typed text via keyboard, create tables, and insert pictures. However, unlike a word processor, users can write anywhere on a virtually unbounded document window by just clicking there. Also, users do not need to explicitly save their work – OneNote saves data automatically as the user works.
Microsoft also announced a number of new features in OneNote that use the service API:
OneNote Clipper: A browser bookmarklet that uses the OneNote service API and enables users to save a screenshot of a webpage to OneNote along with the link. The text in the screenshot is made searchable using Optical Character Recognition
https://en.wikipedia.org/wiki/Microsoft_OneNote

Evernote

As well as the keyboard entry of typed notes, Evernote supports image capture from cameras on supported devices, and the recording of voice notes. In some situations, text that appears in captured images can be recognized using OCR and annotated. Evernote also supports touch and tablet screens with handwriting recognition. Evernote web-clipping plugins are available for the most popular Internet browsers that allow marked sections of webpages to be captured and clipped to Evernote. If no section of a webpage has been highlighted, Evernote can clip the full page. 
Where suitable hardware is available, Evernote can automatically add geolocation tags to notes.

In 2010, the coding language for the suite was changed from C# for version 3.5 to C++ in version 4.0 to improve performance.
On supported operating systems, Evernote allows users to store and edit notes on their local machine, using a SQLite database in Windows.

The Evernote software can be downloaded and used as "stand-alone" software without using the online portion of an Evernote account (online registration is required for initial setup, however), but it will not be able to upload files to the Evernote server, or use the server to synchronize or share files between different Evernote installations. Also, no image or Image-PDF (Premium only) recognition and indexing will take place if the software is used entirely offline.

In June 2016, Evernote announced the limitation for users of its free Basic account to two devices per year and raise prices for its premium service tiers.Non-paying Evernote user is able to sync notes between two devices.

https://en.wikipedia.org/wiki/Evernote
https://help.evernote.com/hc/fr

Evernote does OCR images so they're searchable,  but the text is not extractable from the image.  OneNote is better for that specific use case - the text (or the best approximation of it) is available in a separate window to be copied and pasted elsewhere.  Voice to text is part of Evernote,  though you'd need to use one of the specialist pen inputs if you want to choose specific parts of the text to hear again.
in fact no OCR (may be with premium and for some specific img (buz card)).


Evernote with other apps:
Skitch is a free screenshot editing and sharing utility for OS X (iOS, Windows, and Android). The app permits the user to add shapes and text to an image, and then share it online. Images can also be exported to various image formats. Originally developed by Plasq, Skitch was acquired by Evernote on August 18, 2011. On December 17, 2015, Evernote announced that it will be ending support for Skitch for Windows, Windows Touch, iOS, and Android on January 22, 2016. Evernote said it will continue to offer Skitch for Mac and  iPad iPhone.
https://evernote.com/intl/fr/products/skitch

8 choices:
  1. Capture Viseur 
  2. Zone de capture précédente
  3. Capture viseur différé 
  4. Capture plein écran 
  5. Capture fenêtre... 
  6. Capture menu...
  7. Capture avec |'appareil photo... 
  8. Ouvrir une Image ou un PDF...

Scannable
If you're a die-hard Evernote user, Scannable may be the best option for you...assuming you use an iOS device, that is. Scannable on the iPhone and iPad allows you to instantly scan business cards, sketches, receipts, paper documents, and even multi-page documents with ease, and automatically file and organize the resulting images and files in your Evernote account. Your scans are automatically cropped to remove backgrounds (like the table behind the recipt, for example) and enhanced so the text is readable. If you scan a business card, the contact information from the card is automatically lifted and added to a contact card, so you can call the person, email them, or visit their website or social presence with a single tap. It's relatively new, and while it works best with Evernote, it also allows you to share your resulting scan with other apps on your iOS device, so you can upload it to Dropbox, email it, or save it to your camera roll. Best of all, it's completely and totally free—no unlocks, no premium version, although it definitely works best if you also use Evernote.
It is the business card wingman that knows the card is significant only because of the information it holds. While the paper is trivial, its words are full of potential. Once you connect to Evernote and LinkedIn, Scannable immediately digitizes every business card you scan. It takes that information and adds in details from your contact’s LinkedIn profile, including a photo, so you’ll always be able to put a face to the name. Instantly save the person to your contact list and feel free to ditch the paper entirely (we won’t tell anyone).
Scannable captures the paper in your life quickly and beautifully, transforming it into high-quality scans ready to save or share. Whether on the go or at the office, send paper on its way and move on.
Evernote's Scannable is just one of several apps that allows you to scan documents with your smart phone.
only for iPad & iPhone.

penultimate
Penultimate is the award-winning digital handwriting app for iPad that combines the natural experience of pen and paper with power of Evernote’s sync and search features. Lose the paper, keep the handwriting.
only for ipad
https://evernote.com/intl/en/products/penultimate

Evernote Web Clipper
Save webpages forever
From interests to research, save anything you see online—including text, links, and images—into your Evernote account with a single click.
plug-in for many browsers
https://evernote.com/intl/en/products/webclipper

evernote inc  and github
https://github.com/evernote

 Evernote and OneNote

comparison between 

Google OCR and drive

Google Drive includes a little-known free OCR tool that is a powerful, easy to use image to text converter.
Google Drive currently supports OCR for .jpg, .gif, .png, and PDF files up to 2MB in size

To add your documents to Google Drive to get them OCRed, first go in to your Google Drive account. On the My Drive page, click the My Drive button next to the New button on the left side of the page. Select Upload Files.
Use the Upload files option to upload a file to Google Drive. Find the file that you want to convert from PDF or image to text. Click the Open button. 
The document now appears in your Google Drive. Right-click on the document to bring up a drop-down menu.
Click the Open with option and click Google Docs. A sheet icon appears while the file is downloading. Google is now in the process of converting your PDF or image file to text with OCR.
The file will open in Google Docs with the PDF converted to text, but with little formatting applied. You can now edit and format the new text file as you like.
You will get:


Tutorial:

Free and Open soft

https://turtlapp.com/docs/
no OCR

Free Open source OCR

Comparison of the 3 open source OCR

Tesseract 

Tesseract has unicode (UTF-8) support, and can recognize more than 100 languages "out of the box".
Tesseract supports various output formats: plain-text, hocr(html), pdf, tsv, invisible-text-only pdf.
You should note that in many cases, in order to get better OCR results, you'll need to improve the quality of the image you are giving Tesseract.
Tesseract does various image processing operations internally (using the Leptonica library) before doing the actual OCR. It generally does a very good job of this, but there will inevitably be cases where it isn't good enough, which can result in a significant reduction in accuracy.
Installing Tesseract
You can either Install Tesseract via pre-built binary package or build it from source.
Supported Compilers are:
  • GCC 4.8 and above
  • Clang 3.4 and above
  • MSVC 2015, 2017
The Tesseract engine was originally developed as proprietary software at Hewlett Packard labs in Bristol, England and Greeley, Colorado between 1985 and 1994, with some more changes made in 1996 to port to Windows, and some migration from C to C++ in 1998. A lot of the code was written in C, and then some more was written in C++. Since then all the code has been converted to at least compile with a C++ compiler. Very little work was done in the following decade. It was then released as open source in 2005 by Hewlett Packard and the University of Nevada, Las Vegas (UNLV). Tesseract development has been "sponsored" by Google since 2006.
https://en.wikipedia.org/wiki/Tesseract_(software)
Tesseract is executed from the command-line interface.
Basic command line usage:
tesseract imagename outputbase [-l lang] [--oem ocrenginemode] [--psm pagesegmode] [configfiles...]
For more information about the various command line options use tesseract --help or man tesseract.
GUIs and Other Projects using Tesseract OCR
While Tesseract is not supplied with a GUI, there are many separate projects which provide a GUI for it. One notable example is OCRFeeder (end 2014).
https://github.com/tesseract-ocr/tesseract/wiki/User-Projects-%E2%80%93-3rdParty

PDF OCR X (uses this Tesseract code) is a simple drag-and-drop utility for Mac OS X and Windows, that converts your PDFs and images into text documents or searchable PDF files. It uses advanced OCR (optical character recognition) technology to extract the text of the PDF even if that text is contained in an image. This is particularly useful for dealing with PDFs that were created via a Scan-to-PDF function in a scanner or photo copier.
mac/win
0€=Limited to single-page images and PDFs (pro=29€ for unlimited pdf size)
http://solutions.weblite.ca/pdfocrx/

other projects with tesseract code

  • Online OCR services
  • Android/iOS
  • ocr-fileformat is a converter: Validate and transform between OCR file formats (hOCR, ALTO, PAGE, FineReader)
  • Audiveris is an open-source Optical Music Recognition software which processes the image of a music sheet to automatically provide symbolic music information in MusicXML standard.
  • Wolfram Mathematica 9.0 use tesseract for recognizing text
  • OCRmyPDF - Adds OCR text layer to scanned PDF files and images, allowing them to be searched. Processes pages in parallel on multi-core CPUs. Keeps exact resolution of original embedded images without recompressing JPEGs, when possible. Includes image several preprocessing options, detailed documentation, and support for many exotic PDFs.
  • Tally-Ho: Tally-Ho is a screen reader intended for sites like google books
    https://code.google.com/archive/p/tallyho/
    Tally-Ho is a screen reader intended for sites like google books (though it will also read anything copied to the clipboard). google books is a great site, especially if you're a Ph.D. student - however, for people who are visually impaired or dyslectic (or, like my gf, both...), it is quite inaccessible. Tally-Ho uses the Tesseract OCR engine (thanks google!) to convert the screen capture to text, so it can read graphic based sites such as google books. tested on windows xp sp2 w/at&t natural voices & vista w/microsoft
    End of dvpment 2008
  • IMPACT is a project funded by the European Commission. It aims to significantly improve access to historical text and to take away the barriers that stand in the way of the mass digitisation of the European cultural heritage. END = 2012 and other forks...
    http://www.impact-project.eu/
  • MathOCR Features mathematical formula recognition and logical layout analysis, can use OCR engines like Tesseract or Ocrad as back-end. https://github.com/chungkwong/MathOCR
    END=2015.

GOCR

END=2013

Cuneiform

https://en.wikipedia.org/wiki/CuneiForm_(software)
END=2011

web services OCR


Monday, June 12, 2017

XBOXOneX caractéristiques et détails techniques GPU



Xbox One X est la nouvelle console produite par Microsoft, qui sera capable d’afficher des jeux en 60 FPS/4K native sur votre téléviseur et sera capable de prendre totalement en charge la Réalité Virtuelle. La firme américaine profitera d’ailleurs de l’E3 2017 (Jun 13, 2017 – Jun 15, 2017) pour +.

60 FPS/4K signifie une définition de 3 840 × 2 160 pixels à 60image/s et 8bit/pixels.
pas le format 4K-cinéma (4 096 × 2 160 pixels) utilisé en cinéma numérique.
https://fr.wikipedia.org/wiki/T%C3%A9l%C3%A9vision_%C3%A0_ultra-haute_d%C3%A9finition
https://en.wikipedia.org/wiki/Ultra-high-definition_television

La console embarquera un processeur basé sur l’architecture Jaguar, avec huit coeurs cadencés à 2,3 Ghz. Elle accueillera pas moins de 12 Go de mémoire GDDR 5 : 9 Go seront alloués aux jeux, et 3 Go au système d’exploitation de la Xbox One X.

Son GPU, ou circuit graphique, se rapprochera de celui d’une Radeon RX480. Sa puissance de calcul devrait lui permettre de faire tourner les jeux actuels en 4K dans d’excellentes conditions.

Les caractéristiques techniques de la Xbox Scorpio en détails :

  • CPU à architecture Jaguar (8 coeurs cadencés à 2,3 Ghz)
  • 12 Go de mémoire vive de type GDDR 5 (6,8 Ghz, 386 bits)
  • GPU similaire à la RX 480 (1172 Mhz, 40 unités de calcul, prise en charge de DirectX 12, 6 Téraflops théoriques)
  • 320 Go/s de bande passante
  • Disque Dur 1 To (2,5 pouces)
  • 4K native
  • Lecteur Blu-Ray 4K UHD


La Xbox One X coûterait 499€ lors de sa sortie prévue le 7 novembre 2017.

Site twitter

https://twitter.com/hashtag/XboxOneX?src=hash

Thursday, February 16, 2017

PDF interpreter. Converter .docx (Word)to PDF. Mac quartz PDF context or adobe mac plug-in or other ways Microsoft Word Online or Libreoffice?



For example, try to save a word file (word 2011 or 2016) to PDF, you have many possibilities.

mac quartz PDF context 

https://en.wikipedia.org/wiki/Quartz_(graphics_layer)

OS X is the first operating system on the market that actually uses PDF technology within the operating system itself. Apple calls this technology ‘Quartz’. Quartz is a layer of software that runs on top of Darwin, the core (or kernel) of the Mac OS X operating system. It is responsible for the rendering of all 2D objects. Alongside Quartz, OpenGL takes care of handling 3D data (used in games like Quake or Unreal as well as professional 3D applications like Maya) and QuickTime handles multimedia stuff (movies, sound,…).

Quartz replaces QuickDraw, which was used within earlier versions of MacOS. Within QuickDraw, the native file format was PICT. With Quartz, this now becomes PDF.

Quartz can render text with sub-pixel precision; graphics are limited to more traditional anti-aliasing, which is the default mode of operation

Quartz performs a number of tasks that include include:
  • automatic PDF generation and save-as-PDF (disk and clipboard)
  • conversion of PDF data to raster data or PostScript. The fact that Quartz can rasterize PDF files means that even cheap inkjet printers can output complex files. Gone are the days when only the screen preview of EPS-files was printed on non-PostScript printers.
  • a consistent feature set for all printers
  • automatic on-screen preview of graphics
  • high-quality screen rendering
In short: Quartz implements a set of rules for describing how pictures and text are displayed and printed. Because Quartz uses the PDF drawing model for imaging, native applications can create and import PDFs without the need for outside programs. Even spool files sent to a printer are PDF data.

Some people have been wondering whether Apple pays licenses to Adobe for the technology used in Quartz. Here is what an Apple employer had to say about this: “The Quartz renderer and the PDF interpreter that Apple ships with Mac OS X are built with Apple code, with no external licenses, by Apple employees. Adobe just publishes a specification for how it’s supposed to function. This gives Apple considerably more flexibility with regard to what Quartz and the PDF interpreter can be used for.”

https://developer.apple.com/library/content/documentation/GraphicsImaging/Conceptual/PDFKitGuide/PDFKit_Prog_Intro/PDFKit_Prog_Intro.html#//apple_ref/doc/uid/TP40001863

https://developer.apple.com/search/?q=quartz%20pdf

Adobe PDF versus Quartz PDF

Since Quartz uses PDF, one would assume that everything that is possible within a PDF file is also supported by Quartz. This is not the case. Quartz uses only some of the features of PDF, it is based on a subset of the full PDF specs.

These are some of the things that are used within both the official PDF specs and Quartz:
  • the PDF imaging model
  • Common color spaces: grayscale, RGB and CMYK
  • Embedding of images (even though Quartz does not support masks)
And these are things that are feasible in PDF but that are not implemented in Quartz for Mac OS 10.3 (Panther):
  • Annotations
  • Forms
  • Actions
  • Digital signatures
In fact, one of the main differences between both systems is that the PDF specs are now at version 1.7 while Quartz uses specs that are somewhere between PDF 1.3 and 1.4.

The advantage of having a PDF-based OS

PDF-support within Mac OS X is a good thing. Using PDF as an internal file format increases the acceptance of PDF as a file format for exchanging data. Programmers use PDF in a number of interesting ways. Take the database program Filemaker as an example: the native OS X version of FileMaker Pro 5.5 allows users to import PDF documents as QuickTime movies that they can attach to records.
The actual implementation of PDF within Quartz offers acceptable results for use in a prepress environment. Apple could still improve things but OS X 10.3 as an operating system is the closest fit to prepress that you will find on the market. Even though the PDF viewer in OS X is not as powerful as Adobe reader, it is far faster and a worthy alternative.

https://www.prepressure.com/pdf/basics/osx-quartz (2013)

Quartz PDF creation displays the lowest version number needed to view the file...
try exporting a simple SU model and it will show as being version 1.3...
add an xls table in layout and it will show as 1.5 or higher...
maybe you could add a 1.7 feature to your watermark and then all your exports will show as 1.7...
https://forums.sketchup.com/t/export-layout-to-pdf-version-1-7-on-mac/33564/5 (2016)

adobe mac plug-in

Here it's not quartz, but adobe's code which creates the PDF.

Others

Microsoft Word Online

web services

https://www.iskysoft.com/pdf-tips/top-word-to-pdf-online-converter.html

LibreOffice

convert .doc or .docx
to libreOffice
Version: 5.3.0.3 (2017; mac)

Problems with foot note (with equation)

But the pdf with Table of Contents is dynamic, tagged...
many choices of img compression.
Then this step is OK.


Tuesday, February 14, 2017

nouveautés et améliorations importantes dans word 2016



2 parts of this post
french (français) and english (anglais)

français

Désormais, vous pouvez insérer et modifier des fichiers graphiques SVG (Scalable Vector) dans Word 2016. Insérez simplement votre fichier SVG comme n’importe quel autre fichier image et vous recevrez une barre d’outils personnalisée des outils d’édition pour vous aider à rendre l’aspect que vous voulez. Pour plus d’informations, voir Insérer SVG images.
https://support.office.com/fr-fr/article/Ins%C3%A9rer-SVG-images-69f29d39-194a-4072-8c35-dbe5e7ea528c

Équations manuscrites

L’insertion d’équations mathématiques devient un jeu d’enfants. Vous pouvez désormais accéder à Insertion > Équation > Équation manuscrite pour inclure une équation mathématique complexe dans votre document. Si vous avez un appareil tactile, vous pouvez utiliser votre doigt ou votre stylet tactile pour écrire des équations mathématiques à la main. Word 2016 convertit celles-ci en texte. (Si vous n’avez pas d’appareil tactile, vous pouvez également utiliser une souris pour écrire). Par ailleurs, vous pouvez effacer, sélectionner et corriger ce que vous avez écrit au fur et à mesure.


pour certains handicaps, une accessibilité intégrée
https://support.office.com/fr-fr/article/Nouvelles-fonctionnalit%C3%A9s-d-accessibilit%C3%A9-dans-Word-69aed572-336e-4722-a97e-23393cc481b2?ui=fr-FR&rs=fr-FR&ad=FR

pour certaines équipes, la collaboration temps-réel.


Ref.
https://support.office.com/fr-fr/article/Nouveaut%C3%A9s-de-Word-2016-pour-Windows-4219dfb5-23fc-4853-95aa-b13a674a6670?ui=fr-FR&rs=fr-FR&ad=FR

english

As a word processing tool, Word 2016—which, at present, is only available as part of an Office 365 subscription—hasn’t changed much since its last major release as Word for Mac 2011.

Microsoft has also added some Mac-only features of its own, including a Smart Lookup feature that integrates Bing searches and other contextually relevant information from the web when you use the tool on selected text. All of the Office products also include something that Microsoft now refers to as the Task Pane, which, for my money, is an awful lot like Office’s old Floating Palettes, without the floating. In short, the Task Pane provides an easy way for you to make quick formatting changes to text and other document elements without having to rely on a menu or Ribbon element.

In fact, the new Mac version is as clean as Word on the iPad, which is an excellent app, and it also has some of the same limitations. The upside to this sameness is that, whether you’re working on a PC at your office, your iPad on the train, or your Mac at home, you’ll find the tools you need in substantially the same places.

Word 2016 isn’t without disappointments, but they are by no means deal killers. Word takes no advantage of Apple’s Autosave and Versions features. So you’re stuck with what now seems like a vestige of some ancient past. Have a power failure? Dog step on your power strip? You’re relegated to the weeping and gnashing of teeth you no longer expect when bad things happen and you have unsaved changes in a document. This also seems to be tied to Word’s collaboration features, which, while excellent, are not as dynamic as I’d like them to be. If you’re editing a document while someone else is also making changes, you don’t see their changes until both they and you save the document. (Compare this with Pages, which updates changes almost as soon as they’re made, no matter who is editing the document.) Finally, Word doesn’t support Yosemite’s option to rename and/or move a document using the menu in the document’s title bar.



Fusionner des documents révisés par divers auteurs dans Word

Contexte

Vous avez rédigé un document (par ex. Thèse.docx) et souhaitez le faire relire à 3 personnes en utilisant le système de Suivi des modifications. Ce document devant être révisé par 3 personnes en même temps, vous optez pour l’envoi de 3 copies à vos relecteurs (nous sommes donc en présence de 4 fichiers au total). Une fois que vos relecteurs auront apporté leurs modifications, vous souhaitez pouvoir fusionner les documents révisés avec votre document original.

Solution

Faites un backup de votre fichier original (Thèse.docx)
  • Ouvrez votre document (Thèse.docx) et activez le Suivi des modifications (Onglet Révision > Suivi des modifications > Activé
    • Sauvegardez-le et envoyez une copie à vos 3 relecteurs
    • Plus tard, lorsque vous recevez les documents révisés en retour, renommez-les afin de vous y retrouvez (dans mon exemple, les fichiers en retour vont s’appeler Révisé1.docx, Révisé2.docx et Révisé3.docx)
  • Ouvrez votre document original (Thèse.docx)
  • Veillez à ce que le Suivi des modifications soit désactivé
  • Ouvrez le menu Outils > Fusion de documents
  • Dans la boîte de dialogue Combiner des documents, sélectionnez à gauche votre document original (Thèse.docx) et à droite le premier document révisé (Révisé1.docx) et indiquez éventuellement le prénom du premier relecteur
  • Cliquez sur le bouton ∨ afin d’obtenir les options de la boîte de dialogue
  • Choisissez d’afficher les modifications dans le Document original ou dans un Nouveau document et validez
  • Traitez les modifications et les commentaires apportés en les acceptant ou en les refusant (Onglet Révision > Groupe Modifications ou Groupe Commentaires)
  • Procédez de la même manière avec les 2 autres documents révisés (Révisé2.docx et Révisé3.docx)


https://people.unil.ch/jacquelinefrey/2015/11/word-2011-compiler-des-documents-revises/

Friday, February 10, 2017

EndNoteWeb et word: Insérer des références bibliographiques dans un document Word

Contexte

Vous synchronisez votre librairie EndNote avec votre compte MyEndNoteWeb (voir article https://people.unil.ch/jacquelinefrey/2014/10/endnote-synchroniser-sa-bibliotheque/ ). Vous êtes en train de travailler sur un ordinateur ne possédant pas EndNote. Vous aimeriez insérer dans un document Word des références provenant de votre compte MyEndNoteWeb.

Solution

Ouvrez Word 2011 > dans la barre d’outils EndNote, cliquez sur Tools > Cite While You Write Preferences*
Cliquez sur l’onglet Application > choisissez EndNote online
et
url =  https://my.endnote.com
votre pass endNote online.

Si nécessaire, tapez l’identifiant de votre compte et validez; la barre d’outils d’EndNote s’adapte et propose d’insérer les citations depuis votre compte MyEndNoteWeb
Remarque : lors de la rédaction de cet article (15.02.2016) l’accès aux Préférences d’EndNote depuis la version Word 2016 Mac est bugué.

https://people.unil.ch/jacquelinefrey/2016/02/endnoteweb-inserer-des-references-dans-un-document-word/

https://people.unil.ch/jacquelinefrey/2015/09/contourner-lincompatibilite-entre-office-2016-et-endnote/

recherche poussée dans word


Vous souhaitez effectuer des recherches un peu plus poussées que d’habitude et vous séchez sur l’utilisation des caractères génériques proposés comme option dans la boîte de dialogue Rechercher ?

Solution dans le tableau ci-dessous

our rechercherTapezExemple
N’importe quel caractère unique
?
s?t
trouve sot et set
N’importe quelle chaine de caractères
*
s*t
trouve sautsalutsot et set
Le début d’un mot
<
<fac
trouve facilefacultéfacebook mais pas Facebook ni interface
La fin d’un mot
>
nuit>
trouve nuitminuit et Inuit mais pas nuitée
Un des caractères spécifiés
[ ]
t[ai]c
trouve tac et tic mais aussi vertical, article et notice
N’importe quel caractère compris dans la plage spécifiée
[-]
tou[r-t]
trouve tourtous et tout mais pas toux
N’importe quel caractère, à l’exception de ceux compris dans la plage spécifiée[!x-z]t[!a-m]c
trouve toc et tuc mais pas tac ou tic
Exactement n occurrences du caractère précédent
{n}
ip{2}
trouve Philippe et Hippodrome mais pas Philip
De n à m occurrences du caractère ou de l’expression précédente
{n,m}
10{3,4}
trouve 1000 et 100000 mais pas 10 et 100

https://people.unil.ch/jacquelinefrey/2016/06/word-rechercher-a-laide-de-caracteres-generiques/