{"as_of":"2026-08-24T01:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77cc490c95516bdf8319e24dfaea16361b29c9f687f66f34113aea0dccc1aff9","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:13:42.336168Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.18750/citation-record","integrity":"/paper/2507.18750/integrity","json":"/paper/2507.18750/citation-record.json","paper":"/paper/2507.18750"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.15668","last_updated":"2025-06-25T20:57:49Z","snapshot_observed_at":"2026-08-19T19:08:46.789608Z","submitted_at":"2024-05-24T16:05:15Z","title":"What Do You See? Enhancing Zero-Shot Image Classification with Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15668","snapshot_observed_at":"2026-08-15T18:13:42.054330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.054330Z"},"links":{"cited_paper":"/paper/2405.15668","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:7fc75dba29ee666881e10dca4629d4581e43fc6da05317b096faccb6066ee5b0","observation_id":"ccc13960-892e-4e40-ab59-5ad58144472f","resolution":{"observed_at":"2026-08-15T18:13:42.054330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T18:13:42.059928Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.059928Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:1d87d0e977ccc17f19b480c365049645512634c053862a01c5f727a9bbaceb6c","observation_id":"a758c430-ceea-4e4e-8a85-2e8f3c72db6e","resolution":{"observed_at":"2026-08-15T18:13:42.059928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00878","last_updated":"2024-05-01T21:43:57Z","snapshot_observed_at":"2026-08-17T03:31:45.335086Z","submitted_at":"2024-05-01T21:43:57Z","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00878","snapshot_observed_at":"2026-08-15T18:13:42.065118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.065118Z"},"links":{"cited_paper":"/paper/2405.00878","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:871e0ebc250d8bdf9f915042ba68801d06a1784f22746b21fcff58a88a0081e4","observation_id":"d3d021f6-9f6a-4498-a883-9392eda63844","resolution":{"observed_at":"2026-08-15T18:13:42.065118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.069444Z","title":"Sutherland, Michael Arbel, and Arthur Gretton","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.069444Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:aaa4900e611ba41a71ccf8bc3d5143b782dfcb025416134f783f8444b4caa8b0","observation_id":"1ce79bbe-a78a-4956-9c0e-d7e4c04723fa","resolution":{"observed_at":"2026-08-15T18:13:42.069444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.077678Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.077678Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:bdef34cff1dacf674778a1f80c85c6cc3866b8503464b107f09a2757fbec4918","observation_id":"393c4dea-b931-45e2-8729-cdb0499ca2a8","resolution":{"observed_at":"2026-08-15T18:13:42.077678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.081891Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.081891Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:32fedce72da1ef9ba6278f64b4829c1a21654fc6d95c85ddf734d649ec15f878","observation_id":"b89a6921-58f8-469c-aa55-fa4db9409259","resolution":{"observed_at":"2026-08-15T18:13:42.081891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.176920Z","title":null,"venue":null,"work_id":"932031e8-0cd3-4947-98c4-f439b1432b6c","year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.086994Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:db473bb8e8f370e8371623eab16fac65f8b5b0e3ce8bc54e45c7bd8fa1488625","observation_id":"a5298197-2a44-485b-9a65-dad68cb0eed4","resolution":{"observed_at":"2026-08-15T18:13:43.180676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.096798Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.096798Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:6c34455f6792b39397d364595fe0a19f52ad6ff8bc5ac07baac07e2a473d2c25","observation_id":"a7d1c716-7b90-4506-9aee-87eb394be3bc","resolution":{"observed_at":"2026-08-15T18:13:42.096798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.153260Z","title":null,"venue":null,"work_id":"89f25009-27ff-4342-aa14-0256bac58be0","year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.102201Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:5a09afddce9099ae7ab3dfaaa58e092562c072894a365c38d5e5bde81137cbc4","observation_id":"c1933e3c-c50e-46d2-af4b-93f82f1eeceb","resolution":{"observed_at":"2026-08-15T18:13:43.157828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.138182Z","title":null,"venue":null,"work_id":"f1c9efa3-434e-48d0-8909-90f95e772020","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.107636Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:b808d81b05ebb42d7f47115da7fe6c2a18af1c5124b366a7728e515dd7fb298c","observation_id":"c06281be-2262-46a6-abe8-1df33b8c8049","resolution":{"observed_at":"2026-08-15T18:13:43.143270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.113084Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.113084Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:7bebcc1944c0782f7d52ca184ac346b050dd3d1c9f5cd42bac3eea96fbf6da19","observation_id":"d882abd4-190a-435f-8bbd-1a312b51d455","resolution":{"observed_at":"2026-08-15T18:13:42.113084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.122203Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.122203Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:6ea9cae19671d9b5de4157f11c0be717127bdaa9fb70d02ed51fe03cee417035","observation_id":"f4ff0221-b699-4ed1-ac87-8ec2f6185b64","resolution":{"observed_at":"2026-08-15T18:13:42.122203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.126570Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.126570Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:227e56303c1f7921dede885b738bdb83407000502295d7401a6a38a20c9749be","observation_id":"5cfa3b4e-e282-4b7b-854e-c21ccf38d64c","resolution":{"observed_at":"2026-08-15T18:13:42.126570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.130998Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.130998Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:f966bffb8b1bf457d8e0fb26e86541c02b51109b48dc63b44749637f22c2b60f","observation_id":"3af42b30-2822-46cd-b569-981545d5bc1a","resolution":{"observed_at":"2026-08-15T18:13:42.130998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08500","last_updated":"2018-01-12T14:05:44Z","snapshot_observed_at":"2026-08-22T05:12:22.477450Z","submitted_at":"2017-06-26T17:45:23Z","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08500","snapshot_observed_at":"2026-08-15T18:13:42.135414Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.135414Z"},"links":{"cited_paper":"/paper/1706.08500","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:57cbc8fb2ba4db09afe2965efa37ba18b3a82a70d82c8f67eb14d7bfaf6a7214","observation_id":"01df060e-758c-47bc-89f7-bd95219bc461","resolution":{"observed_at":"2026-08-15T18:13:42.135414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.073082Z","title":null,"venue":null,"work_id":"46644c84-e97e-4eeb-8ddc-7bde06e5c923","year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.140771Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:2dde6197a8c0e4b945cc42995c370db5892e6209dee06437bebc93da5db05109","observation_id":"10128b6c-324c-4ef3-a921-0c94d09c3df8","resolution":{"observed_at":"2026-08-15T18:13:43.077895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.056638Z","title":null,"venue":null,"work_id":"1ece9539-749f-4303-b25f-01b71335265d","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.150594Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:0cc02abf0ad2079c7152bccb88bb7b895288816fbf5befb01923eca13cb338b2","observation_id":"63713efa-7a81-4bbc-a9e7-c560ec43c68a","resolution":{"observed_at":"2026-08-15T18:13:43.061492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.042578Z","title":null,"venue":null,"work_id":"e60b0b90-a0c6-40c4-91f7-8264e3a0f3d0","year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.154979Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:52fc9be6893f5cb5a2a31c9a145701eff697fdf0d7f30b3325b5efaf59fe114f","observation_id":"5e8bb902-79c8-466c-a311-17fe1dda67a0","resolution":{"observed_at":"2026-08-15T18:13:43.046587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.027551Z","title":null,"venue":null,"work_id":"83afa82a-9b2b-4ab6-9a59-0c60241df4e1","year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.159219Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:60d3f2dda0d067cc669a837e503c2e1e68a49a7235997d0a79e1c8523e3285cd","observation_id":"d4cefa96-1303-4954-814f-c7e040a503c1","resolution":{"observed_at":"2026-08-15T18:13:43.032666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04001","last_updated":"2023-05-23T06:59:30Z","snapshot_observed_at":"2026-08-20T07:40:12.299298Z","submitted_at":"2023-05-06T10:26:56Z","title":"AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04001","snapshot_observed_at":"2026-08-15T18:13:42.163499Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.163499Z"},"links":{"cited_paper":"/paper/2305.04001","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:5415c124a69be64f7c2a31b66ce6dee61ac16a17bb63e26ce794ba299b78259e","observation_id":"23ceac24-8882-4ac7-b704-c5f89ab7bc36","resolution":{"observed_at":"2026-08-15T18:13:42.163499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.013267Z","title":null,"venue":null,"work_id":"b883b11e-5899-4b5e-8f15-ea714097bc98","year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.168053Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:ca2017f8114cbd318848c6a733b3b66012ce27281b9ff697b0c967c0f998e0c5","observation_id":"f3360c56-5e90-4e1a-98d4-07cafd0efee4","resolution":{"observed_at":"2026-08-15T18:13:43.017752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02405","last_updated":"2023-09-05T17:36:40Z","snapshot_observed_at":"2026-08-19T00:32:19.348535Z","submitted_at":"2023-09-05T17:36:40Z","title":"Generating Realistic Images from In-the-wild Sounds","version":1},"cited_work":{"arxiv_id":"2309.02405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.02405","snapshot_observed_at":"2026-08-15T18:13:42.607655Z","title":"Generating Realistic Images from In-the-wild Sounds","venue":"cs.CV","work_id":"9f8fd765-5b12-4384-844d-2ae6a8b8d6da","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.173203Z"},"links":{"cited_paper":"/paper/2309.02405","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:39c97b085ba44320a5449ae215be1aa2a9f3fde20dd8f1899c5b48a83ec75c86","observation_id":"3935455c-aea9-4795-be28-9a9899b51d5a","resolution":{"observed_at":"2026-08-15T18:13:42.611915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.998562Z","title":null,"venue":null,"work_id":"b4dbc44a-ab2f-46a9-a825-1bdad927ae5b","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.179176Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:9893e85b3ed45f331e0f7deac4086d47c98277c2c9616495cb2303664ff42141","observation_id":"7c4dbade-1d96-4972-b3af-2ac71cbb8595","resolution":{"observed_at":"2026-08-15T18:13:43.003224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.183398Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.183398Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:cadad9901f37ce40ecc93b5b73b9e1d63c3b2e2204e93bc35a8dbb0a77c2b638","observation_id":"9c8ab432-d106-49a7-a787-42119eda21b3","resolution":{"observed_at":"2026-08-15T18:13:42.183398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.188591Z","title":null,"venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.188591Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:16703a7a87c0b0aacf830518dc1e199238c1aa6bf09b884f11870882d453ac60","observation_id":"913470ea-4893-481d-bda1-b66606b6250e","resolution":{"observed_at":"2026-08-15T18:13:42.188591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.964726Z","title":null,"venue":null,"work_id":"050b273a-4c0d-4183-97ce-321dfbd0ee93","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.194021Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:147f83825334e00de5f67d18ea77429f92011900312666073a6849cc241c4f1a","observation_id":"7f05b8e1-ebc9-4216-8175-25a70461884c","resolution":{"observed_at":"2026-08-15T18:13:42.969071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-21T15:06:56.612400Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-08-15T18:13:42.198876Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.198876Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:b281045ede7e23919fc5a40f4ddf1e3229f83ef5352740480268725b4d5fae83","observation_id":"1002a0ea-1397-4d72-809d-8b9e051199df","resolution":{"observed_at":"2026-08-15T18:13:42.198876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.950183Z","title":null,"venue":null,"work_id":"27f7f609-fba3-43e4-bda2-4256bd604ce8","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.204323Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:c22851721b4a05fda47960764553b672de215d1c6803e9feb18d23ac023a5aef","observation_id":"206e9341-b909-4893-a6c3-7f7671b9794a","resolution":{"observed_at":"2026-08-15T18:13:42.954916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06708","last_updated":"2023-04-13T17:57:01Z","snapshot_observed_at":"2026-08-19T00:32:21.127181Z","submitted_at":"2023-04-13T17:57:01Z","title":"Verbs in Action: Improving verb understanding in video-language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06708","snapshot_observed_at":"2026-08-15T18:13:42.208738Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.208738Z"},"links":{"cited_paper":"/paper/2304.06708","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:02b724de5e8bf5c8902383b816ffb026cb1b44595533f5ddf7a2ecebbae9ad75","observation_id":"47adc57a-a63e-4b88-8ab3-d99fe3fa6aca","resolution":{"observed_at":"2026-08-15T18:13:42.208738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-15T18:13:42.213418Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.213418Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:cbae5d03cc61f242df91a92c3afa25f9d650f8aaec57e2b163c188284099e1f8","observation_id":"4c5cf2fb-5584-4d3f-97ba-05b6338305b8","resolution":{"observed_at":"2026-08-15T18:13:42.213418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.218310Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.218310Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:1b15b0a4cb0e0512189a237ff2bda866311834de5cd2002227b9e339b103e701","observation_id":"4b5ecbb3-7546-456e-a93e-e1e337c8dbb1","resolution":{"observed_at":"2026-08-15T18:13:42.218310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-15T18:13:42.223364Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.223364Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:fcf32be1cf333249d776edd7207ac812cf8193b50d8e1bb286c17c110ad6ed11","observation_id":"2752b778-46f2-42db-813b-1f217636be87","resolution":{"observed_at":"2026-08-15T18:13:42.223364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.936391Z","title":null,"venue":null,"work_id":"96115966-0613-4d97-85f3-4dd86ba15f9f","year":2015},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.228851Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:2f66cb45c4eb2f358c791926aa4779a805cde18ce0372cee35012f70a2efd5df","observation_id":"7f596643-4f95-432c-9950-61c5f62249ae","resolution":{"observed_at":"2026-08-15T18:13:42.940708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.921661Z","title":null,"venue":null,"work_id":"0493a5b1-9653-4c2c-b505-26859ded26b4","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.233207Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:32a3797e80dee852da1eedec58ed15b329e44af8b8a798519df8d7fc1ddb9eff","observation_id":"1f40cd43-3563-4343-aeed-92802e0a8e8f","resolution":{"observed_at":"2026-08-15T18:13:42.926311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.907245Z","title":null,"venue":null,"work_id":"35864281-6142-4a48-9b3f-309beef4a24e","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.237721Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:c747eb6c1dc1dfa2961ed08ccf3731d53915a2cdaedb25908d3dc6127543c03f","observation_id":"a54b5364-cdd9-4603-ab1e-01ad1ae2db14","resolution":{"observed_at":"2026-08-15T18:13:42.911101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.242116Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.242116Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:6001c9ad625e95cf8a312d46231f2582a0c5581186c867c3a7ba56c7ee22adfd","observation_id":"97824ef0-5093-4afc-b369-35a5708c41d9","resolution":{"observed_at":"2026-08-15T18:13:42.242116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.247370Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.247370Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:551a0dc1a03dafecacbd60e889013930f0b931465de024b5a9f23c82d44f1052","observation_id":"378208aa-b929-485f-ac4a-0523c7b17c0e","resolution":{"observed_at":"2026-08-15T18:13:42.247370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.252095Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.252095Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:f25a748ffb12398cbf005c883d179cccaade4571f0eec0f7dd55fe3bfdc86141","observation_id":"01d98179-04fe-4754-a7f9-a2b427971545","resolution":{"observed_at":"2026-08-15T18:13:42.252095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.256550Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.256550Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:d5411530672af56f9ecd1d2a1de93700285b10fdd0a29c31b6ea044cef5d5f47","observation_id":"25a6320d-1a8d-40e0-aad6-5628bd644641","resolution":{"observed_at":"2026-08-15T18:13:42.256550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.857773Z","title":null,"venue":null,"work_id":"534e6927-f407-4d03-96e2-f4c8bf2d1706","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.264979Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:cf3a265e23b86d225469d9f1d01b1a5aafa735aa08993f1e0e663edd0899bfa4","observation_id":"bcb65fc8-f573-40d2-9ea0-c79b9dcf1da3","resolution":{"observed_at":"2026-08-15T18:13:42.862198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.268788Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.268788Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:59f028bd8a6ec190b6b62181be67eb96293a1cdf6d8bc5738cba017bfa1db7d8","observation_id":"1a33667d-af6a-45f0-a455-1216868f7d61","resolution":{"observed_at":"2026-08-15T18:13:42.268788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17718","last_updated":"2023-11-15T14:57:32Z","snapshot_observed_at":"2026-08-19T15:28:27.259276Z","submitted_at":"2023-05-28T13:16:03Z","title":"FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17718","snapshot_observed_at":"2026-08-15T18:13:42.273111Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.273111Z"},"links":{"cited_paper":"/paper/2305.17718","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:cc7084844ff53748d5b8147acbcc0b4309ac553392d24994de6351ec35024230","observation_id":"1a82cd5f-0bed-4b83-80e7-a9577800ad85","resolution":{"observed_at":"2026-08-15T18:13:42.273111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.834541Z","title":null,"venue":null,"work_id":"2265dba6-33f1-4096-8011-6aa109feb584","year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.277827Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:ef2b87ecfd86bcd0750353121b345f1f6dda8a7f55a800b2b4cd5bad193c83f0","observation_id":"74178116-f38b-4157-a939-a836a8aa083e","resolution":{"observed_at":"2026-08-15T18:13:42.839054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-15T18:13:42.260731Z","title":"arXiv preprint arXiv:2204.06125 1, 2 (2022), 3","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.260731Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:3a3cb3e48e07a512ffa12f4c88ea11ebbcfecd48e71d20b38f3017916840907f","observation_id":"1111d075-90a0-4e14-bea7-26c7f339556c","resolution":{"observed_at":"2026-08-15T18:13:42.260731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00645","last_updated":"2024-12-31T20:53:45Z","snapshot_observed_at":"2026-08-19T00:30:59.758944Z","submitted_at":"2024-12-31T20:53:45Z","title":"SoundBrush: Sound as a Brush for Visual Scene Editing","version":1},"cited_work":{"arxiv_id":"2501.00645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00645","snapshot_observed_at":"2026-08-15T18:13:42.420424Z","title":"SoundBrush: Sound as a Brush for Visual Scene Editing","venue":"cs.CV","work_id":"ae5f0ef0-4ca1-4755-8fe3-25a1539d199d","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.287255Z"},"links":{"cited_paper":"/paper/2501.00645","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:cdc6f6bd70c6217becd8a4d4efd34d034b2953eadc27b65c63667d943bc8a780","observation_id":"fc29233e-5e3b-4210-8b0c-81ac245f7d64","resolution":{"observed_at":"2026-08-15T18:13:42.427187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.292419Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.292419Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:7599a0d20962d362c9beccb5c41100c07881b86e9e80c3c75bf10340f317008e","observation_id":"244e5cb2-34ff-4444-9c22-dc2742564d90","resolution":{"observed_at":"2026-08-15T18:13:42.292419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.301691Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.301691Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:229783b98dcf7c1ba68a896152b9b5768e454defd75504ac44bae93955bc4338","observation_id":"0ed6f90d-7869-474f-aa02-24b2c7cd021a","resolution":{"observed_at":"2026-08-15T18:13:42.301691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T18:13:42.306094Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.306094Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:49c17c392f3b5fee178bc9cd41de9480e86b750c7ebe49fba5fb26511d7eec1a","observation_id":"45e5f480-ed2a-4b7a-a791-83cb7313b86e","resolution":{"observed_at":"2026-08-15T18:13:42.306094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.820161Z","title":null,"venue":null,"work_id":"8a6267df-106f-4b46-af62-8bbfd235c25c","year":2014},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.282434Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:d960c1fcb92dcb12f2c08a1ad1c74ec9236173b84be85560e94885b139a63d22","observation_id":"fb8a7905-ac08-4385-9eaa-6abceab2cc0f","resolution":{"observed_at":"2026-08-15T18:13:42.824664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.316736Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.316736Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:e2860b691d8c1a46840de63e8bba1216c9920c24f5c353cfd8a450432e89b5f5","observation_id":"c5a3ccac-dd21-4028-8884-13a1492c85ee","resolution":{"observed_at":"2026-08-15T18:13:42.316736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13050","last_updated":"2023-05-22T14:02:44Z","snapshot_observed_at":"2026-08-16T15:31:05.369222Z","submitted_at":"2023-05-22T14:02:44Z","title":"AudioToken: Adaptation of Text-Conditioned Diffusion Models for Audio-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13050","snapshot_observed_at":"2026-08-15T18:13:42.321168Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.321168Z"},"links":{"cited_paper":"/paper/2305.13050","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:4b291b19905a736247843147c58423243bf3d52a28d866f6a7a6a3f240a80c49","observation_id":"4ec3b67f-2025-4498-9bf0-861c79ff1164","resolution":{"observed_at":"2026-08-15T18:13:42.321168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.297121Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.297121Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:6b7c1928f52eda42c3733dc002224b23fd97f7472e5c8f0158c658e11b674bbf","observation_id":"755140ad-6731-475b-b5fb-8e7ed3892aed","resolution":{"observed_at":"2026-08-15T18:13:42.297121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.332089Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.332089Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:6ce1cf06c9e036102b00bd7413de0265e1f88521d04cdd5e45c62f5d0b77d2f3","observation_id":"2ec3c1bc-07e1-4e1d-a7b1-f3aa4bd056f8","resolution":{"observed_at":"2026-08-15T18:13:42.332089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.746605Z","title":"dog” and “engine idling","venue":null,"work_id":"43584a06-940b-4b0c-b7f0-3d9e474f51cf","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.336168Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:693f06b1ccda65f4be48c803b2351c766c2f23131dec4861b2a62e2c8b6070d7","observation_id":"f0478445-4a2e-498a-b0f2-30bd03a9eadb","resolution":{"observed_at":"2026-08-15T18:13:42.750979Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.778790Z","title":null,"venue":null,"work_id":"021d02c9-ed67-4aac-9a56-02950485abb2","year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.311659Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:d5982aafb060b4e06bceff8b23c0dbb521a26b02591fd11c3009b3c07569093a","observation_id":"29279c59-0211-4e88-a2d5-e12f4f40b377","resolution":{"observed_at":"2026-08-15T18:13:42.783525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05191","last_updated":"2024-11-14T21:26:33Z","snapshot_observed_at":"2026-08-19T00:32:18.820266Z","submitted_at":"2024-06-07T18:17:17Z","title":"DiffusionPID: Interpreting Diffusion via Partial Information Decomposition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05191","snapshot_observed_at":"2026-08-15T18:13:42.326931Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.326931Z"},"links":{"cited_paper":"/paper/2406.05191","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:538453a8dc0e532ace5bea088db74bc93e34cd36e64c6f9407c3266b0eebca50","observation_id":"90d249d7-5694-41e2-9d27-f020e0ae7c58","resolution":{"observed_at":"2026-08-15T18:13:42.326931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01401","last_updated":"2021-01-14T05:36:59Z","snapshot_observed_at":"2026-08-13T06:40:48.610500Z","submitted_at":"2018-01-04T15:25:26Z","title":"Demystifying MMD GANs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01401","snapshot_observed_at":"2026-08-15T18:13:42.073419Z","title":"arXiv:1801.01401 [stat.ML] https://arxiv.org/ abs/1801.01401","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.073419Z"},"links":{"cited_paper":"/paper/1801.01401","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:92fb0efb3987fcd40af2dc3b88f915c3a02f3a16801c5fbb9227f26425c71f84","observation_id":"86d882b3-9bdb-42f8-85d7-84ca607dc62e","resolution":{"observed_at":"2026-08-15T18:13:42.073419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09699","last_updated":"2023-08-17T21:43:24Z","snapshot_observed_at":"2026-08-19T17:14:28.711585Z","submitted_at":"2022-11-15T19:07:53Z","title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09699","snapshot_observed_at":"2026-08-15T18:13:42.145867Z","title":"arXiv preprint arXiv:2211.09699 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.145867Z"},"links":{"cited_paper":"/paper/2211.09699","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:9b0b1a8af4797da1e35e9c96230e1b3fbe54e44b9116d5448d30660387c98a62","observation_id":"1d5b2766-4c0d-461a-8934-0cef90e401ec","resolution":{"observed_at":"2026-08-15T18:13:42.145867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.117607Z","title":"InICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.117607Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:11e23d40f2e0f18829f9d70f93cb56030ddcfb9898a88ee10a345b13316ee7df","observation_id":"f77766c9-38e1-40fc-9e41-3f38b37a29bd","resolution":{"observed_at":"2026-08-15T18:13:42.117607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16406","last_updated":"2025-03-20T17:56:20Z","snapshot_observed_at":"2026-08-19T20:32:54.014623Z","submitted_at":"2025-03-20T17:56:20Z","title":"VerbDiff: Text-Only Diffusion Models with Enhanced Interaction Awareness","version":1},"cited_work":{"arxiv_id":"2503.16406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16406","snapshot_observed_at":"2026-08-15T18:13:42.672001Z","title":"VerbDiff: Text-Only Diffusion Models with Enhanced Interaction Awareness","venue":"cs.GR","work_id":"ffddf656-b711-404a-a0ca-d68dc8adadb1","year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.091627Z"},"links":{"cited_paper":"/paper/2503.16406","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:a39a8e0fa5a907d6f1171df8a8545b75b6589298f190d3ce586ef7c55eaec7bf","observation_id":"732aa0ef-de5a-405d-8faf-cc94ada07170","resolution":{"observed_at":"2026-08-15T18:13:42.676848Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-19T00:31:14.611129Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2507.18750."}