{"as_of":"2026-08-09T19:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e2971660e41ebe50753aae8649fd296e7bfbbcacfd0189b8212761cc714c301","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":3,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":3,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:32:28.346093Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:15:35.725251Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2003.12687","last_updated":"2020-08-08T20:08:37Z","snapshot_observed_at":"2026-08-04T07:16:40.156853Z","submitted_at":"2020-03-28T02:37:09Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12687","snapshot_observed_at":"2026-08-07T04:32:28.346093Z","title":"Serialized output training for end-to-end overlapped speech recognition,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.346093Z"},"links":{"cited_paper":"/paper/2003.12687","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:31f0719c0ce61adb9bd1c5520bad609562c42adc40f2cc3b1ce56ac1ed9fe46c","observation_id":"88a4f7d2-0faa-4bff-8e09-ef6eadc0959e","resolution":{"observed_at":"2026-08-07T04:32:28.346093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12687","last_updated":"2020-08-08T20:08:37Z","snapshot_observed_at":"2026-08-04T07:16:40.156853Z","submitted_at":"2020-03-28T02:37:09Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12687","snapshot_observed_at":"2026-08-07T00:50:17.146989Z","title":"Seri- alized output training for end-to-end overlapped speech recogni- tion,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T16:44:24.354616Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.146989Z"},"links":{"cited_paper":"/paper/2003.12687","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:cefe157cd3b588f30738bbc7b62289a6673e21199b007294422e4ea1e7d1afd9","observation_id":"d14078c9-7074-4944-a84a-b28828a3ee89","resolution":{"observed_at":"2026-08-07T00:50:17.146989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12687","last_updated":"2020-08-08T20:08:37Z","snapshot_observed_at":"2026-08-04T07:16:40.156853Z","submitted_at":"2020-03-28T02:37:09Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","version":2},"cited_work":{"arxiv_id":"2003.12687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.12687","snapshot_observed_at":"2026-08-07T00:15:35.725251Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","venue":"cs.CL","work_id":"a9b2de3a-e407-4432-9beb-976a8766c763","year":2020},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.924764Z"},"links":{"cited_paper":"/paper/2003.12687","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:f9c12ce0b1ff37f0781b3f735026f2c0cc9d360ed933c2dabe8432b9e004dc96","observation_id":"5d7dc434-8070-4b91-bcb5-7a33a907233a","resolution":{"observed_at":"2026-08-07T00:15:35.844750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2003.12687/citation-record","integrity":"/paper/2003.12687/integrity","json":"/paper/2003.12687/citation-record.json","paper":"/paper/2003.12687"},"outbound":[],"paper":{"arxiv_id":"2003.12687","last_updated":"2020-08-08T20:08:37Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T07:16:40.156853Z","submitted_at":"2020-03-28T02:37:09Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 3 inbound Pith citation observations for arXiv:2003.12687."}