{"as_of":"2026-08-14T16:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1389a2ad848b8fc48e9949d1c4e4e7ca08da954b300ca63025f3ba91900a7003","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:04.029122Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:29:44.199281Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-13T11:08:32.439499Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-07T15:43:04.029122Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-12T20:51:21.333120Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.029122Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:5b377e6bb880f620e38ea59e871e83de1fee86bf856e7b39808914bee18c962c","observation_id":"5ad194ca-b72e-4f4d-9468-e213687d7f26","resolution":{"observed_at":"2026-08-07T15:43:04.029122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-13T11:08:32.439499Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-07T15:04:50.995609Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16387","last_updated":"2025-05-22T08:39:48Z","snapshot_observed_at":"2026-08-07T14:59:45.104814Z","submitted_at":"2025-05-22T08:39:48Z","title":"Multi-Channel Sequence-to-Sequence Neural Diarization: Experimental Results for The MISP 2025 Challenge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:04:50.995609Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2505.16387"},"observation_digest":"sha256:0398627dc44b3a84597ab78e060c3ff03e78f4887240d40336d7a2f67d63b928","observation_id":"c2722b4e-f906-42c7-a0ce-6e054e013cac","resolution":{"observed_at":"2026-08-07T15:04:50.995609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-13T11:08:32.439499Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-07T13:32:32.813536Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21445","last_updated":"2025-05-27T17:16:59Z","snapshot_observed_at":"2026-08-07T13:25:17.303544Z","submitted_at":"2025-05-27T17:16:59Z","title":"VoxAging: Continuously Tracking Speaker Aging with a Large-Scale Longitudinal Dataset in English and Mandarin","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:32.813536Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2505.21445"},"observation_digest":"sha256:e27ee430970731cef27e4a2bcf70d76d8ff08341d86ea91aec5a7355ca35d932","observation_id":"05674538-aa95-487b-adc8-d195f47d14ff","resolution":{"observed_at":"2026-08-07T13:32:32.813536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-13T11:08:32.439499Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":"2306.15354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-07-04T09:29:44.199281Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement","venue":null,"work_id":"ed057aff-bb34-4947-bdc9-c310868b0a1d","year":2023},"citing_paper":{"arxiv_id":"2604.22821","last_updated":"2026-04-28T17:29:55Z","snapshot_observed_at":"2026-08-11T13:48:47.306819Z","submitted_at":"2026-04-17T16:41:25Z","title":"Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T07:32:06.306966Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2604.22821"},"observation_digest":"sha256:a7c1774ad4e77275ab4acca008a78e2f3789e688404fc016e7499904e44a28ad","observation_id":"60f6bdce-a975-4e39-94d4-1a574ca3b838","resolution":{"observed_at":"2026-05-10T07:47:13.060741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-13T11:08:32.439499Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":"2306.15354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-07-04T09:29:44.199281Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement","venue":null,"work_id":"ed057aff-bb34-4947-bdc9-c310868b0a1d","year":2023},"citing_paper":{"arxiv_id":"2606.02400","last_updated":"2026-06-02T17:20:11Z","snapshot_observed_at":"2026-08-13T20:35:50.965130Z","submitted_at":"2026-06-01T15:47:01Z","title":"SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T12:37:52.271987Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2606.02400"},"observation_digest":"sha256:2e78c566396da638146440e9d2deb32a3f8fa9e95150c2b2afe2a47fb8084bd3","observation_id":"37562708-62ef-40ff-a7c4-569a13b094c1","resolution":{"observed_at":"2026-07-02T01:06:24.520029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-13T11:08:32.439499Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":"2306.15354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-07-04T09:29:44.199281Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement","venue":null,"work_id":"ed057aff-bb34-4947-bdc9-c310868b0a1d","year":2023},"citing_paper":{"arxiv_id":"2606.22369","last_updated":"2026-06-21T07:39:07Z","snapshot_observed_at":"2026-08-10T02:18:45.511972Z","submitted_at":"2026-06-21T07:39:07Z","title":"Kiwano: A Cutting-Edge Open-Source Toolkit for Speaker Verification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T09:52:58.661879Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2606.22369"},"observation_digest":"sha256:3bb8142e6af0ec3ab9d3a02eb5ef03b31c12d1ff97c494eaf4402c3cd77aa847","observation_id":"a2b513cf-b347-4a4f-8746-82d1435e9877","resolution":{"observed_at":"2026-07-04T09:29:44.201695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-13T11:08:32.439499Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-01T11:33:14.026639Z","title":"3D-Speaker: A Large-Scale Multi- Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:14.026639Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:a9f64ccb741c992aa630eb40c0726ea3463bf4733a9907037c0783978db279e0","observation_id":"505248d2-3a49-4223-b368-65e25321864d","resolution":{"observed_at":"2026-08-01T11:33:14.026639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.15354/citation-record","integrity":"/paper/2306.15354/integrity","json":"/paper/2306.15354/citation-record.json","paper":"/paper/2306.15354"},"outbound":[],"paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T11:08:32.439499Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2306.15354."}