{"as_of":"2026-08-15T16:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84515d639bf3bf96c7e51c47591016ad49e01a1535da5d293fadbdf1ca3068e4","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:32:30.776033Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.10349/citation-record","integrity":"/paper/2506.10349/integrity","json":"/paper/2506.10349/citation-record.json","paper":"/paper/2506.10349"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.216879Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":"5008c276-23a4-445c-8878-a03c08661e03","year":2023},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:27.650243Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:a2f2aea429313c62317be2d1b43b3e0090c5cbb462fedc7027cd2f97d28a3c3d","observation_id":"a56eb7fb-e67d-4b8a-ba72-b8af49fc8c6e","resolution":{"observed_at":"2026-08-07T04:32:32.220372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:27.749181Z","title":"A review of speaker diarization: Recent advances with deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:27.749181Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:989f1397d810438a46e99a72e82ca361ee2e386e52ce2ccc46807270d42caa21","observation_id":"a499c853-59cd-44d6-95fc-4aa43855ff14","resolution":{"observed_at":"2026-08-07T04:32:27.749181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.197863Z","title":"Joint vs sequential speaker- role detection and automatic speech recognition for air-traffic control,","venue":null,"work_id":"2eb30079-a800-470c-b492-3fb5340090ca","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:27.859759Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:7057ced18a86f421a0f5ea5d85d69f7725a1c5e654cfe2be80980de6e74a9383","observation_id":"c6aa7b7a-10db-4bbd-a7ea-4ac0cfda46f3","resolution":{"observed_at":"2026-08-07T04:32:32.201669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-13T12:48:51.709069Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05337","snapshot_observed_at":"2026-08-07T04:32:27.969261Z","title":"Joint speech recognition and speaker diarization via sequence transduction,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:27.969261Z"},"links":{"cited_paper":"/paper/1907.05337","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:0a393ae5ebeea047649f093e4b7caf3aef5c752f069831b2cd1bffacbba38d4b","observation_id":"d9b4c47a-ad4d-405a-b808-72a72c24843f","resolution":{"observed_at":"2026-08-07T04:32:27.969261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.186989Z","title":"One model to rule them all? towards end-to-end joint speaker diarization and speech recognition,","venue":null,"work_id":"f6674e09-a9fb-4cbd-b8b6-5d3527eea20e","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.088900Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:4b4d0a652cf5170e30e92c1a9cfb8344c4c815ea3017bef74eb88f29d40d4e17","observation_id":"d2e40b0a-8d3b-402b-a795-1c6e9919c25c","resolution":{"observed_at":"2026-08-07T04:32:32.191045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06656","last_updated":"2025-07-19T18:18:34Z","snapshot_observed_at":"2026-08-12T22:47:34.809902Z","submitted_at":"2024-09-10T17:20:11Z","title":"Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06656","snapshot_observed_at":"2026-08-07T04:32:28.219916Z","title":"Sortformer: Seamless integration of speaker diarization and asr by bridging timestamps and tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.219916Z"},"links":{"cited_paper":"/paper/2409.06656","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:f63d117ec9078fe75ed8360f58deefca3aba89e97b067f53a895d69a70bcfe3c","observation_id":"df57b59b-7deb-4786-a949-d47497047a53","resolution":{"observed_at":"2026-08-07T04:32:28.219916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12687","last_updated":"2020-08-08T20:08:37Z","snapshot_observed_at":"2026-08-04T07:16:40.156853Z","submitted_at":"2020-03-28T02:37:09Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12687","snapshot_observed_at":"2026-08-07T04:32:28.346093Z","title":"Serialized output training for end-to-end overlapped speech recognition,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.346093Z"},"links":{"cited_paper":"/paper/2003.12687","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:00af0badc7cd99eabee767f2bc019951c4f0d4a32d345037965d56e1bc3466eb","observation_id":"88a4f7d2-0faa-4bff-8e09-ef6eadc0959e","resolution":{"observed_at":"2026-08-07T04:32:28.346093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:28.501651Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.501651Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:530d707a0cf79bed92fbcba06b401ee0aba4c39919a622f7929975147a0a88e1","observation_id":"02be410a-d15b-4189-acfc-7e06fdf39b44","resolution":{"observed_at":"2026-08-07T04:32:28.501651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16212","last_updated":"2025-05-24T20:25:08Z","snapshot_observed_at":"2026-08-13T22:24:14.304830Z","submitted_at":"2025-05-22T04:28:02Z","title":"Large Language Models based ASR Error Correction for Child Conversations","version":2},"cited_work":{"arxiv_id":"2505.16212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16212","snapshot_observed_at":"2026-08-07T04:32:31.069705Z","title":"Large Language Models based ASR Error Correction for Child Conversations","venue":"cs.CL","work_id":"f4a4f33e-6a13-4e52-b182-fc485951b593","year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.582864Z"},"links":{"cited_paper":"/paper/2505.16212","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:16baa3aaa0d2160c991603b7ed41101fba0511ae474f68a94d66b6c2718f8fc3","observation_id":"037f3b84-3a70-477b-82b3-41105d6fdbd0","resolution":{"observed_at":"2026-08-07T04:32:31.149009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.171302Z","title":"Whislu: End-to-end spoken language under- standing with whisper,","venue":null,"work_id":"f77097e1-544e-4f61-a0c3-bdbdabf2f7b5","year":2023},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.696382Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:d4c56ef62aeaeeb1f7baf62f13868606e438c54bd4f6b024c28b74d19e979347","observation_id":"c398d687-7946-4a49-88de-b288647c4b63","resolution":{"observed_at":"2026-08-07T04:32:32.174849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:28.862742Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.862742Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:ddf617bb7295a1220c9b2fb63626daa44d1153c75872ab7118015eed50265231","observation_id":"1590c83d-fced-4424-82f2-2587dd72ea34","resolution":{"observed_at":"2026-08-07T04:32:28.862742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.155247Z","title":"Directional speech recognition for speaker disambiguation and cross- talk suppression,","venue":null,"work_id":"aab62a4d-2fa0-476d-ba16-d26adb66c64e","year":2023},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.959051Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:f05d789b9c7956c920981f29857e67e1e91eda3fc526cccd903866b02471b89a","observation_id":"dd031743-beb8-4c7e-ae96-72d9ab3117c5","resolution":{"observed_at":"2026-08-07T04:32:32.158696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.145072Z","title":"Agadir: Towards array-geometry agnostic directional speech recognition,","venue":null,"work_id":"37ea0dfb-d1f9-45fe-80b4-d66cf0ee342f","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.137476Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:dd727f4f61d1cf90399b7568e74428206550d0b2a168df26787320bc2f5b655e","observation_id":"f85097fe-00ee-45bf-aa30-c361fc1584e9","resolution":{"observed_at":"2026-08-07T04:32:32.148804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.135096Z","title":"Directional source separation for robust speech recognition on smart glasses,","venue":null,"work_id":"27a9d21d-ee49-4741-a9a2-ea20ed9d2777","year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.257872Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:baacc05b7da956683133138d7a14209dcb1d9b4641eb9f321dd2a40d3858ccb6","observation_id":"a856c219-40db-438d-b3ae-ed6df1be813d","resolution":{"observed_at":"2026-08-07T04:32:32.138485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00842","last_updated":"2022-07-14T20:40:04Z","snapshot_observed_at":"2026-08-13T16:48:45.804832Z","submitted_at":"2022-02-02T01:27:21Z","title":"Streaming Multi-Talker ASR with Token-Level Serialized Output Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00842","snapshot_observed_at":"2026-08-07T04:32:29.388286Z","title":"Streaming multi-talker asr with token-level serialized output training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.388286Z"},"links":{"cited_paper":"/paper/2202.00842","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:ca97725725d1593c365b537cdfad3b309d88ca88b7879cd3a6fb1f58e0711251","observation_id":"09ba88e8-626d-4d8d-8e53-1a54f04deab1","resolution":{"observed_at":"2026-08-07T04:32:29.388286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.121043Z","title":"Bertraffic: Bert-based joint speaker role and speaker change detection for air traffic control com- munications,","venue":null,"work_id":"f2b927f9-6817-46c7-919d-5a1ae40011ae","year":2022},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.500842Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:7f9bf86614cb9b4abee4cb1d6f15f25742ce6458bc3c787220362755700c9aac","observation_id":"e8f2ff60-b511-4cd0-b851-ba330a7c4caa","resolution":{"observed_at":"2026-08-07T04:32:32.126102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:29.676078Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.676078Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:b04ca5a967f931d62bb7fea5a8bf289d97623c423d6a230ae0dd99c2d06ab244","observation_id":"22877d80-cfea-492a-94bf-01c534ad243c","resolution":{"observed_at":"2026-08-07T04:32:29.676078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.09972","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:30.939100Z","title":"Who said what wsw 2.0? enhanced automated analysis of preschool classroom speech,","venue":null,"work_id":"685507f8-dd6e-4f22-b0d9-630192efa0fc","year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.756704Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:ddbc5301cae954241b88b18de46d4e381fd4781825ba47b5535b7b6974600782","observation_id":"10c32fc3-2a65-47b7-ba7d-e6d474f1b1c4","resolution":{"observed_at":"2026-08-07T04:32:31.012212Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:29.844757Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.844757Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:1cc8f1e6cfc4943a7ba8517d942632c4b807ccfedbb3696f7aaac2b600b6df7f","observation_id":"4d38ee8c-7cfe-404d-86ed-04b746ea24ed","resolution":{"observed_at":"2026-08-07T04:32:29.844757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.946941Z","title":"Exploring speech foundation models for speaker diariza- tion in child-adult dyadic interactions,","venue":null,"work_id":"fc2f4bd1-eefd-4a7a-a8b2-0be41a5ae56a","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.972442Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:3a8570fb230795dcab54b730cc9ffe6163a0fd42adadddd0c32f68501281399e","observation_id":"4b44b5da-5781-4bf6-a0fe-b697476cb03e","resolution":{"observed_at":"2026-08-07T04:32:32.023994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.751451Z","title":"Data efficient child-adult speaker diarization with simulated conversations,","venue":null,"work_id":"5122f623-33a1-400b-a86e-610db4d0ec4e","year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.007711Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:21561b123154de24c5394da4723e676684de15003c20101d97052b9bb26ff660","observation_id":"a6e47252-1fb9-4101-80f5-121cfbd47230","resolution":{"observed_at":"2026-08-07T04:32:31.877891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14648","last_updated":"2025-05-20T17:36:41Z","snapshot_observed_at":"2026-08-08T04:51:39.118604Z","submitted_at":"2025-05-20T17:36:41Z","title":"Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14648","snapshot_observed_at":"2026-08-07T04:32:30.081659Z","title":"V ox-profile: A speech foundation model benchmark for characterizing diverse speaker and speech traits,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.081659Z"},"links":{"cited_paper":"/paper/2505.14648","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:0511c5c9102375c7d8e36891dc376c14743af85dbe4bef84def397fd34e690fa","observation_id":"65de492a-1c5c-4f55-874d-43f4866d19d2","resolution":{"observed_at":"2026-08-07T04:32:30.081659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.524753Z","title":"The chime-8 mmcsg chal- lenge: Multi-modal conversations in smart glasses,","venue":null,"work_id":"fcc1d6bf-15ec-4bb8-b0b5-ee0344067f35","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.179128Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:a47a67c7b3e4101e36887c0546e538b1df0e1bed41ef09d956960ef22454bfb9","observation_id":"74354199-cc9d-4234-8519-b698d0098208","resolution":{"observed_at":"2026-08-07T04:32:31.637652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-08-14T06:46:00.873540Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-07T04:32:30.227311Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.227311Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:e683bd66a813f63efbb37fcab32f2b7e7e55f631a46066a6876c45ca867a4c4d","observation_id":"97d95895-7355-4b31-83b6-d50e6d76d3c4","resolution":{"observed_at":"2026-08-07T04:32:30.227311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:30.318273Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.318273Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:3777e0e0e4cfbaab3b9da4fe263bce6052bf5990fa3eac3d641669b2a9f7cfaf","observation_id":"d2271d5a-ea78-494c-9b26-a5c82d23040f","resolution":{"observed_at":"2026-08-07T04:32:30.318273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-15T08:41:03.509625Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T04:32:30.437423Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.437423Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:c6e33b142f97484a83dcc1bb7208d46233a0a4a40ff223b4b9983439dd5a8fd1","observation_id":"d8de2a0e-6168-4d88-ab94-a6a625aaacae","resolution":{"observed_at":"2026-08-07T04:32:30.437423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.359753Z","title":"Playlogue: Dataset and benchmarks for analyzing adult- child conversations during play,","venue":null,"work_id":"b9ef463a-70f5-4098-a0e7-fba0b2e16564","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.521621Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:43b0c4c1628842799f9124cffcd2232a7f631c0c0446a019810a0e9ce65378d4","observation_id":"353ba2e7-ac54-4706-b7d4-d03b74d90228","resolution":{"observed_at":"2026-08-07T04:32:31.412456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.187707Z","title":"The talkbank project,","venue":null,"work_id":"70a11840-86fe-4f71-a17b-00ec3b69239c","year":2007},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.571547Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:50d4f0b7e12f8aae46fb68e66502658f2a5388c12ad311d7afd789ecb4c8cf47","observation_id":"5ddb2afe-44ea-4564-848f-49f535c1b8ef","resolution":{"observed_at":"2026-08-07T04:32:31.273720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09577","last_updated":"2019-09-14T03:51:46Z","snapshot_observed_at":"2026-08-03T18:17:55.398298Z","submitted_at":"2019-09-14T03:51:46Z","title":"NeMo: a toolkit for building AI applications using Neural Modules","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09577","snapshot_observed_at":"2026-08-07T04:32:30.682646Z","title":"Nemo: a toolkit for building ai applications using neural modules,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.682646Z"},"links":{"cited_paper":"/paper/1909.09577","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:259589744f3ff1e912c765bf58e4940b9d1deece4eaa39eddcacf281dc40c2f3","observation_id":"3c41ea32-f349-4914-95bf-a58fa6aec58b","resolution":{"observed_at":"2026-08-07T04:32:30.682646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-07T04:32:30.776033Z","title":"Huggingface’s trans- formers: State-of-the-art natural language processing,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.776033Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:b68d0b1e289704a912d172a3557ff6e3c61d8fd91301fdccdbbac2f85124e777","observation_id":"455c2cf4-d61f-4173-84a1-f0b760fedc38","resolution":{"observed_at":"2026-08-07T04:32:30.776033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T13:20:36.391739Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2506.10349."}