{"as_of":"2026-08-17T19:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16b4a8b2da3497d0e3ecce1591e845f60e7a4658f419cf14f526a7a563013ed9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:25:11.559191Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T21:19:03.234818Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.00024","last_updated":"2023-06-28T19:34:16Z","snapshot_observed_at":"2026-08-16T15:20:16.080082Z","submitted_at":"2023-06-28T19:34:16Z","title":"EmoSpeech: Guiding FastSpeech2 Towards Emotional Text to Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00024","snapshot_observed_at":"2026-08-11T19:10:14.102836Z","title":"Emospeech: Guiding fastspeech2 to- wards emotional text to speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07116","last_updated":"2024-12-10T02:06:10Z","snapshot_observed_at":"2026-08-16T04:07:17.817596Z","submitted_at":"2024-12-10T02:06:10Z","title":"A Review of Human Emotion Synthesis Based on Generative Technology","version":1},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:14.102836Z"},"links":{"cited_paper":"/paper/2307.00024","citing_paper":"/paper/2412.07116"},"observation_digest":"sha256:f55a63d2bac80c93807bb563dbaf5494b556321915579185f393aa8518bfb8bf","observation_id":"58dd6b1a-6de1-4649-8ea6-d008f05c8974","resolution":{"observed_at":"2026-08-11T19:10:14.102836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00024","last_updated":"2023-06-28T19:34:16Z","snapshot_observed_at":"2026-08-16T15:20:16.080082Z","submitted_at":"2023-06-28T19:34:16Z","title":"EmoSpeech: Guiding FastSpeech2 Towards Emotional Text to Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00024","snapshot_observed_at":"2026-08-15T20:25:11.559191Z","title":"Emospeech: Guiding fast- speech2 towards emotional text to speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13082","last_updated":"2025-05-19T13:13:46Z","snapshot_observed_at":"2026-08-15T20:18:12.876013Z","submitted_at":"2025-05-19T13:13:46Z","title":"MultiActor-Audiobook: Zero-Shot Audiobook Generation with Faces and Voices of Multiple Speakers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:11.559191Z"},"links":{"cited_paper":"/paper/2307.00024","citing_paper":"/paper/2505.13082"},"observation_digest":"sha256:6a01d943e854404004b3c9a308c8d567c40c79cd96b5c2f1edd6f76f25a39607","observation_id":"24bf4161-6c7d-444c-93c0-c2f5c17b3be1","resolution":{"observed_at":"2026-08-15T20:25:11.559191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00024","last_updated":"2023-06-28T19:34:16Z","snapshot_observed_at":"2026-08-16T15:20:16.080082Z","submitted_at":"2023-06-28T19:34:16Z","title":"EmoSpeech: Guiding FastSpeech2 Towards Emotional Text to Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00024","snapshot_observed_at":"2026-08-06T05:17:05.775601Z","title":"Diatlova and V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2026-08-12T14:00:40Z","snapshot_observed_at":"2026-08-15T23:11:57.132318Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:05.775601Z"},"links":{"cited_paper":"/paper/2307.00024","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:45d89fc31ba0f07be307fdafc221d91e90d685a1d749b005b3a9e0d33e24b242","observation_id":"a6328654-ac4e-4765-a3e6-51717d90e619","resolution":{"observed_at":"2026-08-06T05:17:05.775601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00024","last_updated":"2023-06-28T19:34:16Z","snapshot_observed_at":"2026-08-16T15:20:16.080082Z","submitted_at":"2023-06-28T19:34:16Z","title":"EmoSpeech: Guiding FastSpeech2 Towards Emotional Text to Speech","version":1},"cited_work":{"arxiv_id":"2307.00024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.00024","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guiding FastSpeech2 Towards Emotional Text-to-Speech","venue":null,"work_id":"3f76885b-95b7-434e-8430-1658a99fd5d2","year":2023},"citing_paper":{"arxiv_id":"2605.17583","last_updated":"2026-05-14T13:31:23Z","snapshot_observed_at":"2026-08-15T22:24:13.401279Z","submitted_at":"2026-05-14T13:31:23Z","title":"AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-20T21:14:58.814362Z"},"links":{"cited_paper":"/paper/2307.00024","citing_paper":"/paper/2605.17583"},"observation_digest":"sha256:8277651878425c27f18d0e34e03cbc7e35e7947148cfd49cf7bcacccf1722c71","observation_id":"1183f891-e637-4e9c-bc8d-8eb45fdb4e99","resolution":{"observed_at":"2026-05-20T21:19:03.236339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00024","last_updated":"2023-06-28T19:34:16Z","snapshot_observed_at":"2026-08-16T15:20:16.080082Z","submitted_at":"2023-06-28T19:34:16Z","title":"EmoSpeech: Guiding FastSpeech2 Towards Emotional Text to Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00024","snapshot_observed_at":"2026-08-06T00:40:31.803047Z","title":"Emospeech: Guiding fast- speech2 towards emotional text to speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00998","last_updated":"2026-08-02T04:54:12Z","snapshot_observed_at":"2026-08-15T06:31:49.907405Z","submitted_at":"2026-08-02T04:54:12Z","title":"Beyond One-Size-Fits-All: Personalized and Culturally Adaptive Emotional TTS via Interactive Optimization of Individual Emotion Perception Spaces","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:31.803047Z"},"links":{"cited_paper":"/paper/2307.00024","citing_paper":"/paper/2608.00998"},"observation_digest":"sha256:d6fce727ee0c71cd5b92b53eedecd87e4d6b9410fb2f51585d67d1f3715667b2","observation_id":"5677a6ab-52a9-4e6b-9959-4381e03d0394","resolution":{"observed_at":"2026-08-06T00:40:31.803047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.00024/citation-record","integrity":"/paper/2307.00024/integrity","json":"/paper/2307.00024/citation-record.json","paper":"/paper/2307.00024"},"outbound":[],"paper":{"arxiv_id":"2307.00024","last_updated":"2023-06-28T19:34:16Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T15:20:16.080082Z","submitted_at":"2023-06-28T19:34:16Z","title":"EmoSpeech: Guiding FastSpeech2 Towards Emotional Text to Speech"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2307.00024."}