{"as_of":"2026-08-10T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be5386cd6af9c1183c860dd7756503f467151cf403225bb524d15f2514d61ba5","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:15:57.190957Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11344/citation-record","integrity":"/paper/2506.11344/integrity","json":"/paper/2506.11344/citation-record.json","paper":"/paper/2506.11344"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2018-1768","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"8da2885e-3b3a-4b74-8edb-c4ec3c0db8eb","year":2018},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:54.728975Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:f3c8a1b39e2d4a81e75f74d42439d7cbca2792c22b151acfda95f3d86c5adb26","observation_id":"19df71af-a646-453d-bd7f-104a648e1906","resolution":{"observed_at":"2026-08-07T04:15:58.149537Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:59.902068Z","title":null,"venue":null,"work_id":"f45fd7dc-1fc1-4de9-aa68-7a5f42a789c1","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:54.834097Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:23e7e987406562f2614b277a45804dcbdcb7f83f48217f84e5dc621a3aa88358","observation_id":"993142f4-f037-4220-971b-ab252f940ef2","resolution":{"observed_at":"2026-08-07T04:16:00.034386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:54.918846Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:54.918846Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:a629d63bd057b57896c560cde810178973cefe39191181412e4f74b51d148e70","observation_id":"5ed8ae07-b441-4f7b-a5b7-57f8936c76ed","resolution":{"observed_at":"2026-08-07T04:15:54.918846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.35111/d37s-c536","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Americanae (AECID Library)","work_id":"8784b154-a1ef-4f4f-8d36-353c7423f8cf","year":1996},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.020157Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:8e9027adfbb3cd08d822c3e96aeae6030abf24220b83ef9f4cfe7bdcfbe8accb","observation_id":"cb01b61f-fd41-4c8f-b598-28dd8044266e","resolution":{"observed_at":"2026-08-07T04:15:57.993991Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:55.109864Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.109864Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:2d4354776e753489666bb1796a90cc1e3631dc46a9de53ade5c3b5ab85b3d719","observation_id":"c994171b-17d3-42ab-91b2-5f4411e4ea5f","resolution":{"observed_at":"2026-08-07T04:15:55.109864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.884","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"89215660-fa04-4ddd-b1f2-f1c4d01a6240","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.177313Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:d34ac2f5ad2223f5457dd0536cdbaf6f1e5b997a63a971ce026e27fe3c160637","observation_id":"17be4d74-41e8-4f01-844a-18642bdeb42d","resolution":{"observed_at":"2026-08-07T04:15:57.861434Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:59.675318Z","title":null,"venue":null,"work_id":"9a5e0b5a-fb5d-49ca-80b2-de32c18a2cbc","year":2020},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.283442Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:12b48f2c02e4efb1289a200718472254efe49bbc2e86a376339f35cffaf7b976","observation_id":"a1ed1b1b-f3e6-4de4-bb21-50ba6b6d63de","resolution":{"observed_at":"2026-08-07T04:15:59.800209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21415/t5vg6x","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Chafe, Charles Meyer, and Sandra A","venue":"TalkBank","work_id":"55d61c85-2a07-4309-8c7e-29f7a4a621cc","year":2000},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.365852Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:a199661efe01c132454bef264575a337561922d8e53c7b068d14ae4924c5b070","observation_id":"ace6baef-267f-4a29-ace1-3d71ad5e36f5","resolution":{"observed_at":"2026-08-07T04:15:57.690637Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/odyssey.2020-17","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"f747f076-bb61-4a97-ac1d-d5a400950354","year":2020},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.466266Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:452d3a0a38c005c123c1871913d3c5caa5fc67a716e2d2ae44cdfd22b910d4e0","observation_id":"2e03906e-358a-43e6-a2ed-311dbcc09d67","resolution":{"observed_at":"2026-08-07T04:15:57.520517Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:55.551726Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.551726Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:0cb7ebdebaeb7807ae8e135f897e1dd91243883e5fefb68692fd50131aa668b3","observation_id":"1e835360-9bfd-41d2-a04c-660acea1262a","resolution":{"observed_at":"2026-08-07T04:15:55.551726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:55.634299Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.634299Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:9b6bcf6c88236cfb00871f6323a43329c6a861fb117c4b40fcbf2694f7da012e","observation_id":"79edbcff-71b0-45fd-9ae9-ec794a32c25b","resolution":{"observed_at":"2026-08-07T04:15:55.634299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.11987","last_updated":"2022-11-10T18:59:00Z","snapshot_observed_at":"2026-08-08T11:23:49.984312Z","submitted_at":"2020-03-24T13:02:59Z","title":"Partially Observed Discrete-Time Risk-Sensitive Mean Field Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.11987","snapshot_observed_at":"2026-08-07T04:15:55.779217Z","title":"Janin, D","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.779217Z"},"links":{"cited_paper":"/paper/2003.11987","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:0e2a051a480cda5d728ac86f4a475e0ec7763f9af6b9fdfee67c067b198ac00b","observation_id":"56f28ec8-925f-4801-b71f-28a3d2e7124b","resolution":{"observed_at":"2026-08-07T04:15:55.779217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03151","last_updated":"2022-01-22T01:28:17Z","snapshot_observed_at":"2026-08-06T03:52:39.884353Z","submitted_at":"2021-10-07T02:48:49Z","title":"Transcribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers using End-to-End Speaker-Attributed ASR","version":2},"cited_work":{"arxiv_id":"2110.03151","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.03151","snapshot_observed_at":"2026-08-07T04:15:59.196386Z","title":"Transcribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers using End-to-End Speaker-Attributed ASR","venue":"eess.AS","work_id":"efbe1b85-86d7-4cb2-9c31-0eb7d78d61fc","year":2021},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.873688Z"},"links":{"cited_paper":"/paper/2110.03151","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:c457989b4841a5843f374164fa51e5e9cc7c4333a4cb1fa1a6c0324a226dd7d3","observation_id":"5bf6fa3a-dd23-4e8f-b5a0-d3ce690a832f","resolution":{"observed_at":"2026-08-07T04:15:59.267143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04410","last_updated":"2021-10-08T23:49:42Z","snapshot_observed_at":"2026-08-06T03:08:15.868993Z","submitted_at":"2021-10-08T23:49:42Z","title":"TitaNet: Neural Model for speaker representation with 1D Depth-wise separable convolutions and global context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04410","snapshot_observed_at":"2026-08-07T04:15:55.984530Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.984530Z"},"links":{"cited_paper":"/paper/2110.04410","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:2453b282018d3bdf55821d3218d96e88d71a569202bea891afbd9245617430fc","observation_id":"8a449894-0fcb-4aea-80f3-7b42929f58de","resolution":{"observed_at":"2026-08-07T04:15:55.984530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:56.124519Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.124519Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:bd6e26cd3501377d738768a3e7a6aba53057c178bb43acb1d66520b7bcf8ae6a","observation_id":"4de9f800-773f-4349-84b4-e4badef5a1ff","resolution":{"observed_at":"2026-08-07T04:15:56.124519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05248","last_updated":"2023-09-14T01:08:08Z","snapshot_observed_at":"2026-08-02T16:08:12.372337Z","submitted_at":"2023-09-11T05:47:56Z","title":"Enhancing Speaker Diarization with Large Language Models: A Contextual Beam Search Approach","version":3},"cited_work":{"arxiv_id":"2309.05248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05248","snapshot_observed_at":"2026-08-07T04:15:58.944909Z","title":"Enhancing Speaker Diarization with Large Language Models: A Contextual Beam Search Approach","venue":"eess.AS","work_id":"54048fad-d16e-4f64-8f9f-2868640eda9b","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.218052Z"},"links":{"cited_paper":"/paper/2309.05248","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:30856003414387b11beaefdbc183af32aa017af9058f3819136812383ae4edc7","observation_id":"080148ad-84de-4e4a-a935-70bdf49bc317","resolution":{"observed_at":"2026-08-07T04:15:59.038611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15974","last_updated":"2022-03-30T01:26:31Z","snapshot_observed_at":"2026-08-06T03:55:26.600763Z","submitted_at":"2022-03-30T01:26:31Z","title":"Multi-scale Speaker Diarization with Dynamic Scale Weighting","version":1},"cited_work":{"arxiv_id":"2203.15974","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.15974","snapshot_observed_at":"2026-08-07T04:15:58.796438Z","title":"Multi-scale Speaker Diarization with Dynamic Scale Weighting","venue":"eess.AS","work_id":"e3446be1-ec76-468a-868a-5d9f5bc251a4","year":2022},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.335846Z"},"links":{"cited_paper":"/paper/2203.15974","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:937bde8c90853495e4dc828e80b5badc51797229dd75bad7f60ec9292ce014fc","observation_id":"3942f902-e29f-430b-82eb-ffb37e5f278b","resolution":{"observed_at":"2026-08-07T04:15:58.855167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1982","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"8b627bbd-366f-4397-932a-03782899a872","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.441327Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:abd7dc6492c8dcbcfa929de515d09878ece6f9c1663ce24a62429327500b93c8","observation_id":"af58f791-1946-4fc6-ae89-d2669e4cb1e4","resolution":{"observed_at":"2026-08-07T04:15:57.370849Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:56.524243Z","title":"Pedregosa, G","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.524243Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:2e79d1913603ac7053634959c06601776286847af386657050f7fccf57e2e046","observation_id":"301c54e8-c851-4259-9ddd-bfd8ba67088e","resolution":{"observed_at":"2026-08-07T04:15:56.524243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:59.436786Z","title":null,"venue":null,"work_id":"501623e9-064e-4d93-98b9-aad178bdb448","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.604502Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:ab0317e3b5f447bc3b4ac44332e63ff4713edb8461ab0e02d20dd3044d3a48d8","observation_id":"f58fe505-57b4-4c36-866e-44a38872b049","resolution":{"observed_at":"2026-08-07T04:15:59.558334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T04:15:56.689663Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.689663Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:701b0f394d2b98ef4abe6abf423a4fd8406d45c0d7f55bb7b7756f627b63d055","observation_id":"5092846e-ce14-438f-b405-42cea1176d02","resolution":{"observed_at":"2026-08-07T04:15:56.689663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:56.769223Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.769223Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:39342b386596c0513eec258ecf1145cfe96c6e4b3a09c6b2a8a561fc861b9a59","observation_id":"b064a4f8-1330-442d-a145-63034f2a7c02","resolution":{"observed_at":"2026-08-07T04:15:56.769223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05337","snapshot_observed_at":"2026-08-07T04:15:56.818718Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.818718Z"},"links":{"cited_paper":"/paper/1907.05337","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:6a1439e2c16c3943834c7f7c041a1ba8dcb435335a7b46d531cfb026ab32e27e","observation_id":"80d5c565-14c0-4f84-9a26-578fc0102d5e","resolution":{"observed_at":"2026-08-07T04:15:56.818718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:56.910787Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.910787Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:5d5cceb6dd6aff510d5ac7f392b0a0c2e67d469bbd9bed44edbde14dfec8433e","observation_id":"5c3e1fbd-692c-4af9-b0eb-b9c200824229","resolution":{"observed_at":"2026-08-07T04:15:56.910787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05397","last_updated":"2023-12-13T12:03:39Z","snapshot_observed_at":"2026-08-10T05:27:36.285849Z","submitted_at":"2023-03-08T05:05:26Z","title":"TOLD: A Novel Two-Stage Overlap-Aware Framework for Speaker Diarization","version":2},"cited_work":{"arxiv_id":"2303.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05397","snapshot_observed_at":"2026-08-07T04:15:58.390853Z","title":"TOLD: A Novel Two-Stage Overlap-Aware Framework for Speaker Diarization","venue":"cs.SD","work_id":"a4a53d41-2d5c-4ffd-9f12-5963ca8e5597","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:57.027068Z"},"links":{"cited_paper":"/paper/2303.05397","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:6ad06cdb375287175e1d498cd7df4cbe93ad5aaa6b5809350169d86b6c2ed1be","observation_id":"bb8a8c06-2f04-4733-acc7-4a8a7c0ad7f4","resolution":{"observed_at":"2026-08-07T04:15:58.644634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10468","last_updated":"2022-01-23T23:10:05Z","snapshot_observed_at":"2026-07-06T06:06:33.136974Z","submitted_at":"2017-10-28T13:59:17Z","title":"Speaker Diarization with LSTM","version":7},"cited_work":{"arxiv_id":"1710.10468","doi":null,"metadata_source":"pith","pith_arxiv_id":"1710.10468","snapshot_observed_at":"2026-08-07T04:15:58.250956Z","title":"Speaker Diarization with LSTM","venue":"eess.AS","work_id":"7889f39e-2ed6-4999-ab96-e9531a187217","year":2017},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:57.099168Z"},"links":{"cited_paper":"/paper/1710.10468","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:434da98fa3adbc7da641a12783c4644a160af8161c28484c17f978af20fed384","observation_id":"ad09241f-898f-46c1-984a-091958cd9c27","resolution":{"observed_at":"2026-08-07T04:15:58.310770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03506","last_updated":"2025-01-08T21:53:33Z","snapshot_observed_at":"2026-08-05T23:31:28.236223Z","submitted_at":"2024-01-07T14:54:57Z","title":"DiarizationLM: Speaker Diarization Post-Processing with Large Language Models","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03506","snapshot_observed_at":"2026-08-07T04:15:57.190957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:57.190957Z"},"links":{"cited_paper":"/paper/2401.03506","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:19dfaa5cccf34d676d4aa482de3981297c2a8b1ed98d2f4593ed866053f09322","observation_id":"a53b12da-abca-4030-807c-aecd224d6911","resolution":{"observed_at":"2026-08-07T04:15:57.190957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2506.11344."}