{"as_of":"2026-08-13T09:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edc6f91c926eedc77ae6dd7d329007dfcd36117575515f53cca10a1bdcc7743e","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:41:42.630260Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:15:19.738180Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02398","snapshot_observed_at":"2026-08-03T14:15:19.738180Z","title":"Audio Realism Bottleneck","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21094","last_updated":"2026-06-02T17:15:46Z","snapshot_observed_at":"2026-08-06T21:10:12.336800Z","submitted_at":"2025-12-24T10:30:35Z","title":"T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T14:15:19.738180Z"},"links":{"cited_paper":"/paper/2509.02398","citing_paper":"/paper/2512.21094"},"observation_digest":"sha256:a0a85bc986f9a87ccc25d055b75addf7bc61192881c67c84a3dfac3a92cf8819","observation_id":"78f06cc1-9ee8-448f-9d55-fd981c687bef","resolution":{"observed_at":"2026-08-03T14:15:19.738180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02398/citation-record","integrity":"/paper/2509.02398/integrity","json":"/paper/2509.02398/citation-record.json","paper":"/paper/2509.02398"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:36.903557Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:36.903557Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:61c15a621ba6854136509a9b573026875d18b47f4b0b66aeafa7ead8f5e70fc6","observation_id":"d5dcd889-720a-45da-8f49-d835ab69ff34","resolution":{"observed_at":"2026-08-05T11:41:36.903557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:36.976869Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:36.976869Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:6a214e488929c250b10f69242e3b64b28dd2cc807f81f7ed8d8846e2975202e2","observation_id":"dc5b1df7-2576-4546-af32-b967b8235916","resolution":{"observed_at":"2026-08-05T11:41:36.976869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T11:41:37.045025Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.045025Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:efaffdc3ba1149eef69eeaad1a005b591465ca5511291a0038aef07be58a248a","observation_id":"b087600a-e585-4099-a12b-e0f2f8840f2f","resolution":{"observed_at":"2026-08-05T11:41:37.045025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.600708Z","title":"M.; Sun, P.; Shen, X.; Khan, F","venue":null,"work_id":"057d79ce-7dab-453b-bb04-5f6e0b17ddd7","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.106208Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:1cbbe5bd92cd5bdfda76d09a87258135f02f0767c73fe2f893826c78ecfc0fd3","observation_id":"3d65202b-f935-4d35-bae0-a9c0b00c2aa0","resolution":{"observed_at":"2026-08-05T11:41:43.605202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01973","last_updated":"2018-06-21T14:54:33Z","snapshot_observed_at":"2026-08-07T19:33:19.839652Z","submitted_at":"2018-01-06T05:44:29Z","title":"A Note on the Inception Score","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01973","snapshot_observed_at":"2026-08-05T11:41:37.186988Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.186988Z"},"links":{"cited_paper":"/paper/1801.01973","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:1754233ffe9b0b5d793611620140d25e267fa571f15bb5a0767074f7b43b3e84","observation_id":"e14e216c-35ab-42a4-ac73-1579598531ca","resolution":{"observed_at":"2026-08-05T11:41:37.186988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.585853Z","title":null,"venue":null,"work_id":"430082d1-16b7-4ca4-a39d-8b997dce2436","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.252463Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:b80948d249e25a099a6ddc631140ccf0579b145104be803967ea0453560bb7d8","observation_id":"a53c0bf7-96e9-4849-934b-a71b8408b3ea","resolution":{"observed_at":"2026-08-05T11:41:43.590096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.570016Z","title":"W.; Hou, L.; Longpre, S.; Zoph, B.; Tay, Y.; Fedus, W.; Li, Y.; Wang, X.; Dehghani, M.; Brahma, S.; et al","venue":null,"work_id":"abbc559c-1a73-46d3-bd3f-6494b52ecb46","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.307296Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:3d11b217e093bdd6a6dbb99f129fc2d98f07c56e77e34d1c2425b205fdf6ae98","observation_id":"d3dfabe1-0107-4e44-9df5-2d3234d90140","resolution":{"observed_at":"2026-08-05T11:41:43.574812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.555060Z","title":null,"venue":null,"work_id":"a7a4d5c8-68b3-45aa-9c7c-9ec727855c71","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.371650Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:bd9393fa0f748564b7c0d5c0871d36abfd23f287a4793b3053c156c50fc058e9","observation_id":"937c0d92-84b3-4b0f-842c-91f695639b2f","resolution":{"observed_at":"2026-08-05T11:41:43.560038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.540244Z","title":null,"venue":null,"work_id":"3466874a-a885-44fd-85d8-f617dd93e045","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.447626Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:046cf06902f16f7b28e7ed64cc329d8609329c85a8df27624e28421ec2fb62d9","observation_id":"8ddc3776-f88f-46da-b2da-0489a567bb41","resolution":{"observed_at":"2026-08-05T11:41:43.544677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.524889Z","title":"D.; Gangal, V.; Gehrmann, S.; Gupta, A.; Li, Z.; Mahamood, S.; Mahendiran, A.; Mille, S.; Srivastava, A.; Tan, S.; Wu, T.; Sohl-Dickstein, J.; Choi, J","venue":null,"work_id":"a53a701e-fd8c-445f-ab80-c54469399023","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.515414Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:e9c4c0a43567ffc3d9e75c415e21ea8cfed4a190e84bb781452285c63f3724c1","observation_id":"a58a4a34-7ce8-4918-b38a-4a478ac7b27e","resolution":{"observed_at":"2026-08-05T11:41:43.529390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.510537Z","title":null,"venue":null,"work_id":"58ec8442-e62b-4e3e-b76c-0d032752ae67","year":2020},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.583856Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:e2638989770b09604218bfac709beb2f4a813181799ea2156f9c12c880acc0bd","observation_id":"7dd7345a-5119-4ac4-aaf5-858887960335","resolution":{"observed_at":"2026-08-05T11:41:43.515163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-10T11:18:27.309853Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-05T11:41:37.651853Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.651853Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:214470efcec6632ab23d84ddc8e4c577fe58fd41922d90e0dbc6b0b44e23959d","observation_id":"f6cfd9a2-ca3e-476d-a1b4-21d2210b9d49","resolution":{"observed_at":"2026-08-05T11:41:37.651853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.495351Z","title":null,"venue":null,"work_id":"c4a586f4-21da-4099-bc39-6be6f1b209da","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.720522Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:a0b3f65ec80c5c96f349f01bb55df91791028fa8d2812be1398f61fa0ffebb59","observation_id":"e06e9f39-3049-41e3-89eb-b7d6dd567c2c","resolution":{"observed_at":"2026-08-05T11:41:43.500134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.481159Z","title":"H.; and Pons, J","venue":null,"work_id":"3d2ae748-915f-46b3-b842-70335ef69159","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.823392Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:ae241936528bb8ba60aa34a3d1cbcea52ef7e367f1c429fa04599303d47b0f92","observation_id":"517f7538-002e-48f8-915f-20c64e00ecdf","resolution":{"observed_at":"2026-08-05T11:41:43.485453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-10T11:18:06.491859Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T11:41:37.929378Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.929378Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:9892a27ccf6a3a1f7821d6ec87770f36a0eee47ba6cde6bf5a96684cd5842713","observation_id":"c73a878b-9120-4d7c-b9d8-0d069b9b32f4","resolution":{"observed_at":"2026-08-05T11:41:37.929378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.465640Z","title":null,"venue":null,"work_id":"f0d278ea-0fa0-4a44-ba30-596fd26693a2","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.046523Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:d0321c198f8b4b63b1eb3add1fec46e66baf254e6e1f65c3371c1f50e73e00cb","observation_id":"4a716745-4ef0-4b1d-a7fc-5a5e4476fd88","resolution":{"observed_at":"2026-08-05T11:41:43.470062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15922","last_updated":"2026-04-08T21:03:14Z","snapshot_observed_at":"2026-08-10T11:18:08.326588Z","submitted_at":"2024-12-20T14:14:00Z","title":"RiTTA: Modeling Event Relations in Text-to-Audio Generation","version":4},"cited_work":{"arxiv_id":"2412.15922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.15922","snapshot_observed_at":"2026-08-05T11:41:43.000825Z","title":"RiTTA: Modeling Event Relations in Text-to-Audio Generation","venue":"cs.LG","work_id":"04d527af-caef-4cb9-af53-22356c11de86","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.120541Z"},"links":{"cited_paper":"/paper/2412.15922","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:ae701dd5ffb81ea40036810aaf3f3de337cfa0d39eedc26fcc10ecf789475540","observation_id":"94347dab-e043-4b53-a086-ac885ed445df","resolution":{"observed_at":"2026-08-05T11:41:43.005859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-08T06:05:53.280034Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-05T11:41:38.158041Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.158041Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:d1ae3fcd1482d34f28764b244a9f23f2e6f8528e08f4dd24cefb4626c2179e5d","observation_id":"aaf4e0b3-ce77-4503-ba96-a8f700c39137","resolution":{"observed_at":"2026-08-05T11:41:38.158041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.449515Z","title":null,"venue":null,"work_id":"1eeaf2a3-4c53-4188-8b18-701cc1599b1b","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.276559Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:528a2afb1d2036a1a4066e190a9bf48e1a33734f6d3d8aec5e61403fe6b0779f","observation_id":"c1f24d91-c294-47b4-bff1-1cac58835ffe","resolution":{"observed_at":"2026-08-05T11:41:43.454703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12661","last_updated":"2023-01-30T04:44:34Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T04:44:34Z","title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12661","snapshot_observed_at":"2026-08-05T11:41:38.414553Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.414553Z"},"links":{"cited_paper":"/paper/2301.12661","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:2ddcc004c53c65e741d576cbf646980d0b5aee0ed124c5a7f6c73b784b598a40","observation_id":"20f76eff-91e0-4932-9428-ddb08a723f8b","resolution":{"observed_at":"2026-08-05T11:41:38.414553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-05T11:41:38.641129Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.641129Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:accc5586dfff5b69e7b806ef2e03c9749346b867399045ea377b9d8a8b6617b0","observation_id":"13c50be9-da31-43b0-98bd-34f50c9807a1","resolution":{"observed_at":"2026-08-05T11:41:38.641129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.433845Z","title":"D.; Kim, B.; Lee, H.; and Kim, G","venue":null,"work_id":"7babe598-f0f3-4b5c-9499-8d2cdc3f2a6c","year":2019},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.838863Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:fc70b0f4fef682df09ac4cbbaebfdd5fb49578b98e2ca9c3fee60fab17a17030","observation_id":"140e9e66-06fc-47b4-a19a-803af9a88787","resolution":{"observed_at":"2026-08-05T11:41:43.438869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.416687Z","title":"D.; Kim, B.; Lee, H.; and Kim, G","venue":null,"work_id":"222b7778-1f9f-4092-8e2d-e01d4a9c4f0c","year":2019},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.975778Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:3677ec89dc8ce9f6b3cf63e487b6c8ff52c63275f615a6c49920836d131ff9af","observation_id":"9df640ce-c8b2-458f-9563-aaa69466c5a7","resolution":{"observed_at":"2026-08-05T11:41:43.421994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.401291Z","title":null,"venue":null,"work_id":"02c3920e-ced9-489a-868b-553240311077","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.124727Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:e45c349ac8c505e0c830bedc79c930fb36fe8521c74bc78b867c92e15b6945bb","observation_id":"e6e2f966-2ed4-4bb1-be30-68fcba4b1134","resolution":{"observed_at":"2026-08-05T11:41:43.405749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.386089Z","title":null,"venue":null,"work_id":"5d52afe1-9b73-4749-8b23-834438ebcf58","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.321695Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:d35ac98055518b26360ad97634dac6c7b304582e926d9f941c43c3d2ae1300cb","observation_id":"784efbf6-f6f0-4cce-ac17-483e7189f1af","resolution":{"observed_at":"2026-08-05T11:41:43.390545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04287","last_updated":"2023-11-07T19:00:56Z","snapshot_observed_at":"2026-08-13T05:30:20.743166Z","submitted_at":"2023-11-07T19:00:56Z","title":"Holistic Evaluation of Text-To-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04287","snapshot_observed_at":"2026-08-05T11:41:39.459567Z","title":"S.; Gupta, A.; Zhang, Y.; Narayanan, D.; Teufel, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.459567Z"},"links":{"cited_paper":"/paper/2311.04287","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:8c9065fcda40e6ad20a6bf2c579b504cfe2feca6825cb7236e043101fd1f2413","observation_id":"6b9ed27e-c7f5-414e-89be-544c7130de33","resolution":{"observed_at":"2026-08-05T11:41:39.459567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.371075Z","title":null,"venue":null,"work_id":"bb4db66d-4c7b-4f57-af88-207c9e6f485a","year":2019},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.622361Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:aba6265cbf014095c94ccb25e5ed5572b980c8c0ab8ab387228327711e41bc8d","observation_id":"ce95158d-1536-4a9b-8d2c-291dd08431e4","resolution":{"observed_at":"2026-08-05T11:41:43.375845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.356354Z","title":null,"venue":null,"work_id":"83625a81-4f6c-4ee4-b712-623eb01d278c","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.778413Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:7894c18db13322243d583a292870eed0745c4f01b8342205dc4e63dad8702a3c","observation_id":"a6cdb93e-131c-40a9-8fd1-2dd359e08ad6","resolution":{"observed_at":"2026-08-05T11:41:43.360815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.341145Z","title":null,"venue":null,"work_id":"e1f185ec-507d-431b-bd8d-49115bb27d07","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.938378Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:598ab084a47f8d4cdf56d59848a2baa539f2aa62df9ceaf5c51356d5bfc8e539","observation_id":"b656a29c-6f60-48eb-ae44-9515c87154bd","resolution":{"observed_at":"2026-08-05T11:41:43.345449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.326267Z","title":null,"venue":null,"work_id":"933875c6-d6db-4deb-9200-56d6ecb23c77","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.116121Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:8eb6935453c244ce2bc89ea5da038518a3dc8eba1cb6f62bab0449852c482df9","observation_id":"c150b44b-e46f-4221-8df9-c1845d1267d7","resolution":{"observed_at":"2026-08-05T11:41:43.330941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.310879Z","title":null,"venue":null,"work_id":"5687f63e-80df-4b0e-845b-1822d3251426","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.315668Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:32f1c39acd6f15c717ec4e5532e42b422a1b53461e75a453b8ddcdfc22ef9c94","observation_id":"1ac895c6-5fdc-4058-a200-3301cdd7472f","resolution":{"observed_at":"2026-08-05T11:41:43.315959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11802","last_updated":"2024-09-21T06:53:58Z","snapshot_observed_at":"2026-08-12T23:40:48.492321Z","submitted_at":"2024-06-17T17:49:01Z","title":"PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11802","snapshot_observed_at":"2026-08-05T11:41:40.468843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.468843Z"},"links":{"cited_paper":"/paper/2406.11802","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:5f1ab6481867f916357f8f855a69f90132847583b34776f084d91e33382c10b0","observation_id":"0089645e-d458-4b19-86f0-c210bd041eae","resolution":{"observed_at":"2026-08-05T11:41:40.468843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.295169Z","title":null,"venue":null,"work_id":"e7dddffd-737f-4fdc-847a-3a674c8c88b8","year":null},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.654768Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:2817124942dc2daa4fb853017160e4a016c661cadbfc71962b21d500080b6faf","observation_id":"6935ba13-45df-4fc8-a068-82646b3520b0","resolution":{"observed_at":"2026-08-05T11:41:43.299743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.280170Z","title":null,"venue":null,"work_id":"326403e5-6551-4f61-916b-8a3b569073cb","year":2021},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.840100Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:febe22189d6bcf24d403d0a3128ed779c98becc5c5d33ea9bd7b6f2c4239d29c","observation_id":"5d563cf9-ffe0-42fd-89c4-8540f68ddaad","resolution":{"observed_at":"2026-08-05T11:41:43.284385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.265464Z","title":null,"venue":null,"work_id":"6d306781-a0c1-49a9-bd6b-4a6134e28613","year":2022},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.001924Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:b75b076648eb84da771f6b4dc795e14c0e1995d2a3d46eb5ffb981aa23c868b9","observation_id":"d5fd21ee-cc51-4183-bda7-048c74c7c5cd","resolution":{"observed_at":"2026-08-05T11:41:43.269921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.250137Z","title":null,"venue":null,"work_id":"c0c38f50-dce6-40b8-8604-f0312f1c70c7","year":2022},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.173082Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:a28023e11076765c79f32492456074b9ecac7d19d40e7bb07bebcc94b7422aa0","observation_id":"ab88f6ed-8e33-4d64-84c0-dcf87ca9b1d2","resolution":{"observed_at":"2026-08-05T11:41:43.254946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.235731Z","title":null,"venue":null,"work_id":"1e4295c6-599e-47d4-bbce-9c21f6472498","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.336409Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:7eb75f65f8e72e75ba9a39ecbfda5c4fa6386f6d4dd3507a6ee7c23eb33a79c7","observation_id":"4e881a39-3b77-4e08-bbfd-d116cabf125f","resolution":{"observed_at":"2026-08-05T11:41:43.240097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.220432Z","title":null,"venue":null,"work_id":"c2eacef2-a684-4925-89ed-eae001ebb94f","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.416723Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:86d1a494522867ba95eccd3d0c076fa34a0396492835f902eaff2cae49275224","observation_id":"8a20bc0f-b9ae-4d1c-8457-133973a5ae50","resolution":{"observed_at":"2026-08-05T11:41:43.225077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11128","last_updated":"2025-09-03T01:59:58Z","snapshot_observed_at":"2026-08-13T09:26:46.588138Z","submitted_at":"2025-02-16T13:54:32Z","title":"FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching","version":2},"cited_work":{"arxiv_id":"2502.11128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11128","snapshot_observed_at":"2026-08-05T11:41:42.733852Z","title":"FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching","venue":"cs.CL","work_id":"9e0d9a01-b398-47a5-a8fe-71f51be57ef6","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.566443Z"},"links":{"cited_paper":"/paper/2502.11128","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:45ceebb0268a4b5962c15ef777d01e0edf2c967bce210bc7d382879e555b3d47","observation_id":"3882d03c-8f3b-4384-b0b7-7ac957202b0f","resolution":{"observed_at":"2026-08-05T11:41:42.890538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.204083Z","title":null,"venue":null,"work_id":"9e618bb0-a229-4d7d-b810-f8235e01c9d2","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.660357Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:034e9c6f2e2616d34324699d96c7fd4ddbf57aecb7c16300302a566846c28ac1","observation_id":"9abecb0d-e6f2-4f8b-8594-6568ab6d476a","resolution":{"observed_at":"2026-08-05T11:41:43.208723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.188935Z","title":null,"venue":null,"work_id":"51b866f9-de6f-4516-a91f-fa0b396879d8","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.756841Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:d36c2901fc3fadb3a3c5219c6d6614c0444034a626975d241f33656469af31e0","observation_id":"b36840fc-59f4-4aad-8907-96cba7160fe0","resolution":{"observed_at":"2026-08-05T11:41:43.193509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.171898Z","title":null,"venue":null,"work_id":"5eb83bc4-31fc-4429-913f-0c4c9755c7f8","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.868703Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:9175122e1f2a520112249f428c2c0996a16cba6dd9c30be5b89a127648a692e9","observation_id":"8b9df95c-1821-417f-91b4-a7c6a258c24e","resolution":{"observed_at":"2026-08-05T11:41:43.176985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.154491Z","title":null,"venue":null,"work_id":"20ca281b-718b-4b28-9d14-5f5e62dcb237","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.995968Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:86737f0cd99d634dee3ed7f0ec26bfe804a8ec9b7256f0ce5bc4d77667abaa57","observation_id":"bf3842b6-0449-42df-81ef-a06a03cd275e","resolution":{"observed_at":"2026-08-05T11:41:43.159259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.138034Z","title":null,"venue":null,"work_id":"ff611d43-d5ee-4275-b036-37b034bcb65c","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.125530Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:3d736762baad814f2cd76905636517416973b80868ce790a2c77e02bfb2cea77","observation_id":"2b744ac6-aaf2-424a-9d5c-fb2601ff76a8","resolution":{"observed_at":"2026-08-05T11:41:43.143181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.121697Z","title":null,"venue":null,"work_id":"8ed3b5dd-a113-4a85-8f42-a0e69136d867","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.233238Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:8e655643fd4d5469564242b4b6f1643fda76fae185566c307cbbabeb13c8023e","observation_id":"e1789211-65e4-4077-840e-30e4b260ce7e","resolution":{"observed_at":"2026-08-05T11:41:43.126932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.105962Z","title":null,"venue":null,"work_id":"e980ab2c-5044-495e-94ab-aa2c38d9cce7","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.373156Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:dafe8dfa67be84997431663d5988f6565ba7b55b7b8a6cae638599c4a6156cf5","observation_id":"d08cdb9f-cf7c-479b-98c4-9afbd3d314b8","resolution":{"observed_at":"2026-08-05T11:41:43.110527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.088759Z","title":null,"venue":null,"work_id":"ba1cfd83-7472-4082-9a25-d89ea99a43f0","year":2021},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.535356Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:5ec4b035bc2941920920fcfbc51702bf975dd3a1eab8dd5ae2f86fe5095d17d6","observation_id":"6cec966d-9254-4725-af83-e8ac718d4b64","resolution":{"observed_at":"2026-08-05T11:41:43.093902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04577","last_updated":"2024-03-05T09:12:35Z","snapshot_observed_at":"2026-08-13T04:45:56.006574Z","submitted_at":"2024-01-09T14:29:39Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04577","snapshot_observed_at":"2026-08-05T11:41:42.630260Z","title":"L.; Remez, T.; Kreuk, F.; Défossez, A.; Copet, J.; Synnaeve, G.; and Adi, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.630260Z"},"links":{"cited_paper":"/paper/2401.04577","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:dc389544cad65c6192f15834aa2ea105d30320d2e17847cd09e2a9d426b677cb","observation_id":"19a3a6ce-5f4d-4403-8478-40003504ead6","resolution":{"observed_at":"2026-08-05T11:41:42.630260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T00:42:26.979233Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2509.02398."}