9月
30
INTERSPEECH2025論文読み会(東京&オンライン)
主催 : 橘健太郎 (LY), 齋藤佑樹 (東大), 高道慎之介 (慶応大)
広告
イベントの説明
概要
2025年8月開催の国際学術会議 INTERSPEECH2025 に関する論文読み会です.機械学習に関する論文を普段読んでいる研究者、学生、エンジニアの方を想定しておりますが、誰でもご参加いただけます.
発表者について
- 先着で募集いたします.ご自身がINTERSPEECH2025で発表された論文の紹介も可能です.
- 論文は,音声合成,認識,知覚,パラ言語,対話,音源分離,音声強調などに関するものとします.ジャンルの配分は調整する場合がございます.
- INTERSPEECH2025 main conference だけでなく,関連ワークショップやコンペティションの論文でも可です.
現地会場案内
- 前回(ICASSP2025読み会)と同様に現地(NBF大崎ビル(旧ソニーシティ大崎))とオンライン(Zoom)のハイブリッド開催となります.
- 現状の現地参加枠は暫定的に50名としていますが,希望者が多い場合は様子をみつつ枠を増やすかもしれません.
- 会場や受付開始時間の詳細は後日追記いたします.
会場へのアクセス
- NBF大崎ビル(旧ソニーシティ大崎)( https://maps.app.goo.gl/1TWzkAL4iqFDZki5A )
- 東京都品川区大崎2-10-1 24F
- 最寄り駅:JR大崎駅 (南改札口、新西口より徒歩2分)
入館方法
- 受付は 17:00 より開始します。
- 受け付けは2Fとなっております。大崎駅南口から繋がるデッキから直接入館可能です。
- 入口にて受付担当が待機しておりますので、受付お願いします。
- 18:30以降は正面ドアが施錠されます。適宜対応いたしますので、ご連絡ください。( @emonosuke)
オンライン会場案内
- ZOOMを使用します.各自インストールをお願いします.
- 17:30 open (Zoom URL)
- 質問は Slido にご記入下さい. (Slido URL)
- 発表資料は Google slide を編集する形でお願いします.
発表形式
- Lighting talk形式で5分とし,質問時間は合間でまとめて取る予定です.
- セッション後にディスカッション・質疑応答の時間を取っておりますので,そちらでも議論頂けます.
- 講演者は,お手数ですが各セッション終了後までは待機頂く様,よろしくお願いします.
- 質問事項はSlidoに記載して頂き,答えて行く形式とします.
- 現地参加の方は,会場のマイクで直接ご質問いただいても構いません.
- スライドは1枚目に 自己紹介スライド をご用意頂き,論文紹介の内容は2-3枚程度に納めてください.
キャンセル
- 参加は先着順になりますが,より多くの方へご参加いただきたいと考えています.
- 大まかな参加人数を把握するために,当日都合が悪くなって参加できないことが判明した方は,お手数ですが速やかにキャンセル処理をお願いします.
その他
- 本勉強会は,技術交流が目的です.知識の共有や参加者同士の交流を目的としない方の参加はお断りします.
- 参加目的が不適切だと判断される場合には,運営側で参加をキャンセルさせていただく場合がございます.
- 読み会終了後,現地会場で懇親会(軽食・ドリンクあり)を開催します.
スケジュール
| 時刻 | 講演者 | タイトル |
|---|---|---|
| 18:00-18:05 | 齋藤 佑樹 (東大) | 開会挨拶 & 諸注意 |
| 18:05-18:10 | 二見 颯 (SONY) | OpusLM: A Family of Open Unified Speech Language Models |
| 18:10-18:15 | 恩田 健太郎(東大) | Differentiable K-means for Fully-optimized Discrete Token-based ASR |
| 18:15-18:20 | 神藤 駿介(東大) | DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models |
| 18:20-18:30 | 質疑応答 | |
| 18:30-18:35 | break time | |
| 18:35-18:40 | 須藤 克仁(奈良女子大) | Aligning ASR Evaluation with Human and LLM Judgments: Intelligibility Metrics Using Phonetic, Semantic, and NLI Approaches |
| 18:40-18:45 | 山本 克彦 (CyberAgent) | No Audiogram: Leveraging Existing Scores for Personalized Speech Intelligibility Prediction |
| 18:45-18:50 | 有田 諒子(東大) | Investigating the Reasonable Effectiveness of Speaker Pre-Trained Models and their Synergistic Power for SingMOS Prediction |
| 18:50-19:00 | 質疑応答 | |
| 19:00-19:05 | break time | |
| 19:05-19:10 | 酒井 眞(朝日新聞社) | ASR Confidence Estimation using True Class Lexical Similarity Score |
| 19:10-19:15 | 蛭田 興明(合同会社Solvance) | Hybrid Data Sampling for ASR: Integrating Acoustic Diversity and Transcription Uncertainty |
| 19:15-19:20 | 杉野 かおり(朝日新聞社) | Bidirectional Spoken-Written Text Conversion with Large Language Models |
| 19:20-19:30 | 質疑応答 | |
| 19:30-19:35 | break time | |
| 19:35-19:40 | 今井 柊平(Parakeet) | LinearVC: Linear Transformations of Self-supervised Features Through the Lens of Voice Conversion |
| 19:40-19:45 | 武 伯寒 (SONY) | Diffusion Buffer: Online Diffusion-based Speech Enhancement with Sub-Second Latency |
| 19:45-19:50 | 井上 聖(CUHK-Shenzhen) | PersonaTAB: Predicting Personality Traits using Textual, Acoustic, and Behavioral Cues in Fully-Duplex Speech Dialogs |
| 19:50-20:00 | 質疑応答 | |
| 20:00 | 齋藤 佑樹 (東大) | 閉会挨拶 |
| 20:00-21:30 | 懇親会 | |
| 21:30-22:00 | 片付け | |
| 22:00 | 撤収 |
資料 資料をもっと見る/編集する
資料が投稿されると、最新の3件が表示されます。
広告

エンジニアをつなぐ
connpass は株式会社ビープラウドが開発・運営しています