{"as_of":"2026-08-19T23:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec7cd2091571431635f47a7b60d802b57454f3423b8014b92872f3b9e5570e68","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:38:52.776117Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:08:20.924375Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T17:52:42.244532Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00265","snapshot_observed_at":"2026-08-07T15:08:20.924375Z","title":"Ssdm 2.0: Time-accurate speech rich transcription with non-fluencies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16351","last_updated":"2025-05-25T01:02:29Z","snapshot_observed_at":"2026-08-19T17:30:11.247202Z","submitted_at":"2025-05-22T08:02:50Z","title":"Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:20.924375Z"},"links":{"cited_paper":"/paper/2412.00265","citing_paper":"/paper/2505.16351"},"observation_digest":"sha256:97c67e583b3b79beef3ba65629db32b81fceb503ae22acd52518ab6b4c2ab92b","observation_id":"6ad04381-2d1e-4e32-80e6-9805e4666fdc","resolution":{"observed_at":"2026-08-07T15:08:20.924375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00265","snapshot_observed_at":"2026-08-07T13:20:20.896344Z","title":"Ssdm 2.0: Time-accurate speech rich transcription with non-fluencies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22029","last_updated":"2025-06-22T18:20:44Z","snapshot_observed_at":"2026-08-15T16:45:09.158446Z","submitted_at":"2025-05-28T06:52:10Z","title":"Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:20.896344Z"},"links":{"cited_paper":"/paper/2412.00265","citing_paper":"/paper/2505.22029"},"observation_digest":"sha256:d48794cc2b3a5e69d1d1518dc55eecac158e93b69e2d93d763cd89f242a676ba","observation_id":"d6e72374-bada-4d24-90a0-ed0d6b78a0a4","resolution":{"observed_at":"2026-08-07T13:20:20.896344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00265","snapshot_observed_at":"2026-08-07T10:45:08.947796Z","title":"Ssdm 2.0: Time-accurate speech rich transcription with non-fluencies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12073","last_updated":"2025-06-05T03:06:37Z","snapshot_observed_at":"2026-08-16T07:52:10.001777Z","submitted_at":"2025-06-05T03:06:37Z","title":"Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:08.947796Z"},"links":{"cited_paper":"/paper/2412.00265","citing_paper":"/paper/2506.12073"},"observation_digest":"sha256:6305cbf31461c76d79814b06cd363d2b3e37d1d2dec25f0fdb0a1cd29610b4de","observation_id":"ee6b3803-d98a-488f-8356-8ee8afb308da","resolution":{"observed_at":"2026-08-07T10:45:08.947796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00265","snapshot_observed_at":"2026-08-06T16:11:25.165013Z","title":"Ssdm 2.0: Time-accurate speech rich transcription with non-fluencies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14346","last_updated":"2025-07-18T19:51:56Z","snapshot_observed_at":"2026-08-17T01:53:21.808406Z","submitted_at":"2025-07-18T19:51:56Z","title":"Towards Accurate Phonetic Error Detection Through Phoneme Similarity Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:11:25.165013Z"},"links":{"cited_paper":"/paper/2412.00265","citing_paper":"/paper/2507.14346"},"observation_digest":"sha256:3a55f9044327a8af0293925d090acf42494921b07d5baa87b24b6b98f30eca23","observation_id":"02cb38b8-b50b-4f95-954f-51845d3705e2","resolution":{"observed_at":"2026-08-06T16:11:25.165013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"cited_work":{"arxiv_id":"2412.00265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00265","snapshot_observed_at":"2026-08-05T17:52:42.244532Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","venue":"eess.AS","work_id":"3973a558-4bc8-460c-bb84-4ef5ad3e98df","year":2024},"citing_paper":{"arxiv_id":"2508.16681","last_updated":"2025-08-21T15:01:05Z","snapshot_observed_at":"2026-08-18T01:01:47.205574Z","submitted_at":"2025-08-21T15:01:05Z","title":"Revisiting Rule-Based Stuttering Detection: A Comprehensive Analysis of Interpretable Models for Clinical Applications","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:52:38.516956Z"},"links":{"cited_paper":"/paper/2412.00265","citing_paper":"/paper/2508.16681"},"observation_digest":"sha256:0ea44e5dd470a340b29cd865ce92c3300ae9a9cd91c2e98ddc000ca0060c56b3","observation_id":"efa9ab3e-fc93-468d-9ff8-51ff24db52fe","resolution":{"observed_at":"2026-08-05T17:52:42.332945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00265/citation-record","integrity":"/paper/2412.00265/integrity","json":"/paper/2412.00265/citation-record.json","paper":"/paper/2412.00265"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-19T17:29:27.622983Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-12T05:38:52.683006Z","title":"You”, Start: 0.02, End: 0.25, Type: null}, … {Word: “to","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.683006Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:5c4eec06ca81bf3df7c213576d47b44efe39e9f4822296222361e55df0361146","observation_id":"7f5c8314-bbe9-4a81-a4d7-f825b5eac8c6","resolution":{"observed_at":"2026-08-12T05:38:52.683006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:53.127020Z","title":"For instance, in ˆH2, we observe a sequence of upper lip elevation, lower lip elevation, and finally, tongue dorsum elevation","venue":null,"work_id":"d3800413-2085-4d08-8510-102aa2fdff4c","year":2024},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.692663Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:5db46ea98f1165ffefc36689917091cf0691bd598df71b9bf1ecd69e6b4d7f97","observation_id":"6a3f55e1-c979-41c4-8436-fb8231b5f687","resolution":{"observed_at":"2026-08-12T05:38:53.133317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:53.077246Z","title":"word\": \"<word>","venue":null,"work_id":"afbad400-4bad-479d-b198-b3d8bf2315a5","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.709596Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:db0336d0b1a163a6f6c307099af3b1ab9b6862824e96bc53d25ddd615cfc77c2","observation_id":"26ca37eb-4a74-4574-bade-863b7f6c8242","resolution":{"observed_at":"2026-08-12T05:38:53.083317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:53.012578Z","title":"word\": \"Hello","venue":null,"work_id":"868db418-e776-4186-89a4-543726280f8f","year":2022},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.731331Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:32482e7d6990c54c083e5db484c185f2dc7638748403782cb99d57811a692a3f","observation_id":"a6f7298c-a5fc-4dba-8ac7-9be6ef0f32b5","resolution":{"observed_at":"2026-08-12T05:38:53.017862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:53.111135Z","title":null,"venue":null,"work_id":"82b606a4-eea1-47b3-8105-cabc57e259ad","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.698526Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:6e2bd0389464608a481b73aa656724b713d75a2fd7fe40ea66c6e7693836fe0c","observation_id":"072ec45b-5bbb-4a3c-9264-8f5d334baa86","resolution":{"observed_at":"2026-08-12T05:38:53.116084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:53.095389Z","title":null,"venue":null,"work_id":"35c21ab2-9027-4c40-98c1-c2dd7f824cda","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.704377Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:73943fbed2f46f039e7273cc19fe29882a38de59c4baba30fe2760c150cea64c","observation_id":"8f518cf7-da55-416b-a5ba-3eba14a4ae5a","resolution":{"observed_at":"2026-08-12T05:38:53.100084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:53.062414Z","title":null,"venue":null,"work_id":"18471ea7-47fe-4948-98cd-cff5f8310e11","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.715078Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:de2480f254d907db86f0c01f18569979f8c6506c26ec81d0e34b4550f57121aa","observation_id":"c39445cd-4cdc-407d-a638-e839f1b0a5ac","resolution":{"observed_at":"2026-08-12T05:38:53.067380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:53.046209Z","title":null,"venue":null,"work_id":"0fb58b3f-55eb-4d69-9c25-1e0908bf6323","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.720249Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:54e1e0b8beddcae8956575feb8d05a59487270c5d702e2eb5d4601f50e32ce2b","observation_id":"775c1a0e-fa99-42dd-822f-5e2d701e58bf","resolution":{"observed_at":"2026-08-12T05:38:53.051530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:53.030037Z","title":null,"venue":null,"work_id":"fff66196-1d4d-4280-af61-0732385dc58b","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.725316Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:36fe76c4ab536dae48366e6d25bbe6ac94c5567f42f768b94aba1b41745b739c","observation_id":"6829a6cb-11f5-4df0-a4ee-c71ad6731b01","resolution":{"observed_at":"2026-08-12T05:38:53.035050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:52.977489Z","title":null,"venue":null,"work_id":"397ab938-ad48-4283-91e1-8593daf84086","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.744533Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:121c40683c9543414c5eba59bca43174f982937f9ae3daaea8dd8e6c2ffe7fef","observation_id":"5bc55373-a9e3-466c-9236-1e4dddd3375e","resolution":{"observed_at":"2026-08-12T05:38:52.983114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:52.958997Z","title":null,"venue":null,"work_id":"cb704919-caca-4095-a39b-a6750c90348d","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.750168Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:20f8ef14c3d8e57e149fec485d65a6dee2e1bef10272e8dc3604fb8773f6176a","observation_id":"4d3bb387-3e67-423c-9435-707cc257054d","resolution":{"observed_at":"2026-08-12T05:38:52.964814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:52.940710Z","title":"• Set has dysfluency to 0 if no entry is generated","venue":null,"work_id":"1a047baf-be5a-418f-ba39-6443a271569e","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.755353Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:53d6690a1bdf67da3e8683f92e7b3b76d3de944fc5d09d12407a1596d559433f","observation_id":"7085cb48-d9eb-431e-9a36-9fd8f133a700","resolution":{"observed_at":"2026-08-12T05:38:52.946024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:52.921955Z","title":"word\": \"I","venue":null,"work_id":"d7653c1a-5d8e-4925-b38c-ade07b392663","year":null},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.760359Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:9b4daf31f6fa925e683f86c860619c3bfb22ba0d23a79128b2c3fcd85f38dca8","observation_id":"120f7a9d-3f1e-4b9a-9347-cda024e9e6cf","resolution":{"observed_at":"2026-08-12T05:38:52.927836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:52.904290Z","title":"has_dysfluency","venue":null,"work_id":"c0f330f0-457f-4dab-b17d-f714cb6c00e0","year":2023},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.765273Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:75fd95471d454392065f2436d692284460fcfd125e9be3380602fca3f7bceab6","observation_id":"2f9c8be5-dc25-478b-ac54-70c4ded3a064","resolution":{"observed_at":"2026-08-12T05:38:52.909620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:52.871655Z","title":"The current mainstream methods treat this problem as a time-based object detection task (Lian et al., 2023c; Lian & Anumanchipalli, 2024; Zhou et al., 2024b;a; Lian et al., 2024)","venue":null,"work_id":"80ca2b44-f5fb-4a08-ae79-4df261a2d8ff","year":2022},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.776117Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:007f7b58903d9c11b98ef5d79f764fcf8a7768934c3b1e5929ba1eeedd4d822a","observation_id":"9c9799ae-f462-4a8a-b08d-2bb7334b15cd","resolution":{"observed_at":"2026-08-12T05:38:52.876599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:52.995271Z","title":"word\": \"<word>","venue":null,"work_id":"59a962fe-ee7e-4d9b-8ead-051c528137ed","year":2020},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.737923Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:a14a5a3d334ff663ccf780fcd1a0b766c8013954de4195e69e35b56dbfbb25df","observation_id":"efd6abfd-cd2d-4750-be9e-c12f9cb61470","resolution":{"observed_at":"2026-08-12T05:38:53.000341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12998","last_updated":"2024-12-14T18:40:28Z","snapshot_observed_at":"2026-08-16T13:41:42.345967Z","submitted_at":"2024-06-18T18:38:17Z","title":"Coding Speech through Vocal Tract Kinematics","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12998","snapshot_observed_at":"2026-08-12T05:38:52.665262Z","title":"doi: https://doi.org/10.1016/j.eswa.2011.07.065","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.665262Z"},"links":{"cited_paper":"/paper/2406.12998","citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:ea345a829a2c7a94cf1577c7374f86b892d338642190f8088ca1ec3dee7cef32","observation_id":"1122258b-5a95-4369-854e-f7d39ae76c51","resolution":{"observed_at":"2026-08-12T05:38:52.665262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02512","last_updated":"2024-10-06T20:00:46Z","snapshot_observed_at":"2026-08-16T16:55:04.304488Z","submitted_at":"2022-06-06T11:51:22Z","title":"Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE","version":4},"cited_work":{"arxiv_id":"2206.02512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.02512","snapshot_observed_at":"2026-08-12T05:38:52.834065Z","title":"Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE","venue":"eess.AS","work_id":"48ba46c1-37b1-4e62-b7df-289689c7da3a","year":2022},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.673856Z"},"links":{"cited_paper":"/paper/2206.02512","citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:25261e4ea7aeceefb045b095a69315c976930e87ed7681383038408bf0609004","observation_id":"86a10e22-b056-482c-86ac-bee8bc1bc36d","resolution":{"observed_at":"2026-08-12T05:38:52.841536Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:38:52.887576Z","title":"VCTK includes speech data uttered by 109 native speakers of English with various accents","venue":null,"work_id":"7310d5ba-ff5a-4f21-b308-b650c1966d68","year":2024},"citing_paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T05:38:52.770475Z"},"links":{"citing_paper":"/paper/2412.00265"},"observation_digest":"sha256:ae1c95dda7958bddb7c9539883328d00deefb41751986ca88f4fe531e293b8dc","observation_id":"0104c436-4e44-4e6d-9887-a369f5cce865","resolution":{"observed_at":"2026-08-12T05:38:52.892668Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00265","last_updated":"2024-11-29T21:39:21Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T17:29:40.142615Z","submitted_at":"2024-11-29T21:39:21Z","title":"SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 5 inbound Pith citation observations for arXiv:2412.00265."}