{"as_of":"2026-08-18T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3f59f130f6973d8cca3db592ee44925beee12b4cd45490477e7535ea32251ac","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:47:42.607909Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06900/citation-record","integrity":"/paper/2608.06900/integrity","json":"/paper/2608.06900/citation-record.json","paper":"/paper/2608.06900"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:47:42.760945Z","title":"A middle-aged male captain aged 40-50 calmly stated in standard English,' The plane is about to land.'","venue":null,"work_id":"3d9297cc-3ece-4653-bb42-80bd07003f5c","year":null},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.589089Z"},"links":{"citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:bb61ce3b506d98b2fc9f35e6ee878426b9be627961d3b377283dee228deefb31","observation_id":"b50f15c7-2a69-4a34-8d45-e9fafc699f51","resolution":{"observed_at":"2026-08-10T18:47:42.766202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:47:42.747597Z","title":"Slow-tempo electronic music with dark melodic elements and synthesized bass","venue":null,"work_id":"81938978-10eb-477a-92d0-6702e04d1016","year":null},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.593527Z"},"links":{"citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:be6daa3ceda7c38672fc8bd44c9d813dbdd3289fc3eedd9f315f235209f12056","observation_id":"02923017-1c12-4c2c-a14d-e56e57586f26","resolution":{"observed_at":"2026-08-10T18:47:42.752081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:47:42.734642Z","title":"event_segments","venue":null,"work_id":"9357e1ee-62dd-4625-9de0-f6b89cb49181","year":null},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.597254Z"},"links":{"citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:e9beb8dcf33187965f212c16f3d49f6854f301b171d2f3702e8ac47c004cfcca","observation_id":"f5b8cf49-af89-4b77-a11b-ad178cd9bc76","resolution":{"observed_at":"2026-08-10T18:47:42.739097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:47:42.721965Z","title":"Indoor/outdoor hybrid environment with significant engine interference","venue":null,"work_id":"33c0716b-eb2d-49e1-89f1-39b15bde60c4","year":null},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.600906Z"},"links":{"citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:998df57fad03042d937742bc5b327bef6bdee6c1813eac8c8352d23cce95f0d8","observation_id":"ce824758-33cb-4a8e-aecd-cda0a6703760","resolution":{"observed_at":"2026-08-10T18:47:42.726067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:47:42.774991Z","title":"InICASSP 2025-2025 IEEE International Conference on Acous- tics, Speech and Signal Processing (ICASSP), pages 1–5","venue":null,"work_id":"3db71ace-a91b-46f5-9834-5c01eb208dce","year":2025},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.581533Z"},"links":{"citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:9b660bcc059728dfa02cbf246c933333260b5d2bd2397b4798e06aac74aa3674","observation_id":"6060bb8b-f359-4ad4-95c1-43c100f2fa18","resolution":{"observed_at":"2026-08-10T18:47:42.780660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-10T18:47:42.584830Z","title":"audio information","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.584830Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:74d4329ebdfc7a41e47b00dc95fcb81d1aa1a20dc808202d950d6110d8172d03","observation_id":"b4908102-271d-49fa-8922-0b68208155e0","resolution":{"observed_at":"2026-08-10T18:47:42.584830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:47:42.708785Z","title":"- If transcription exists, include the complete transcription verbatim, enclosed in quotation marks","venue":null,"work_id":"14d01982-0702-4fda-b9c7-62da55bf1056","year":2023},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.604165Z"},"links":{"citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:bfaf099fc94c2c87ca7e1bdf3562477615333f8f2b8c254c45e379f6841f9756","observation_id":"f43e7efd-5427-46dd-9985-a604f4e7f3db","resolution":{"observed_at":"2026-08-10T18:47:42.714071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:47:42.697529Z","title":"start\",","venue":null,"work_id":"3c6af8d4-3894-4f73-9d46-ddf3c2d49035","year":null},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.607909Z"},"links":{"citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:603f2bbafc46d9222308529fec05af841e258ac13d3e1da23e8d80b6f3b7bc03","observation_id":"2efa3c68-7e07-4b45-a200-8d496d14dfb7","resolution":{"observed_at":"2026-08-10T18:47:42.701360Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03116","last_updated":"2026-06-02T04:00:32Z","snapshot_observed_at":"2026-08-15T07:01:44.048656Z","submitted_at":"2026-06-02T04:00:32Z","title":"AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following","version":1},"cited_work":{"arxiv_id":"2606.03116","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.03116","snapshot_observed_at":"2026-08-10T18:47:42.660643Z","title":"AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following","venue":"eess.AS","work_id":"791280ed-7cb9-43f5-a5f7-01f9b2fbbc99","year":2026},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.573385Z"},"links":{"cited_paper":"/paper/2606.03116","citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:1e42705ebfcc05538ed8f7468076faab69b09342e96aa5133d531dda40074e6a","observation_id":"07bdf583-c4ed-485c-8a6f-36011e4bf7ab","resolution":{"observed_at":"2026-08-10T18:47:42.666812Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-13T04:37:51.305325Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-08-10T18:47:42.577122Z","title":"InInter- national Conference on Learning Representations, volume 2024, pages 12181–12204","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.577122Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:05e8c79cd34fb20b407128387e99074506a1b953d174dd8427f988bb2709d699","observation_id":"8e8bfb50-add5-469a-9e0e-2607d331d688","resolution":{"observed_at":"2026-08-10T18:47:42.577122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-10T18:47:42.569068Z","title":"Jaeyong Kang and Dorien Herremans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.569068Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:89376263392705cbfc6c7c039c7bbc725a7732061e9b6d3a0ba8904bb2369fc3","observation_id":"50206a3c-3d6f-47da-8401-f85120f2b15a","resolution":{"observed_at":"2026-08-10T18:47:42.569068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-18T20:29:58.857701Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-08-10T18:47:42.564368Z","title":"Shawn Hershey, Sourish Chaudhuri, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.564368Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:460019254b857044e28c07d35022ab7ec5e19861c8f773fdfaa9cfd8d13db78b","observation_id":"0e502d4a-dc48-414f-a0ed-78eeb253ad30","resolution":{"observed_at":"2026-08-10T18:47:42.564368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2608.06900."}