{"as_of":"2026-08-10T07:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a694983bf762836ad7cb775a46cc6b4c98fc93cd9dec0f6c079d4432ae327232","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:17.616572Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:14.606479Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:20:19.500789Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"cited_work":{"arxiv_id":"2505.22045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22045","snapshot_observed_at":"2026-08-07T13:20:19.500789Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","venue":"cs.MM","work_id":"59672561-b82e-40ef-ba06-f32d2abff6a0","year":2025},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.606479Z"},"links":{"cited_paper":"/paper/2505.22045","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:062debeec70d1c44645203d85a6841541634a26e50a5ef986839f39d70ea1831","observation_id":"5b3a8d93-2fb8-4921-ad48-6933a4507c29","resolution":{"observed_at":"2026-08-07T13:20:19.650775Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22045/citation-record","integrity":"/paper/2505.22045/integrity","json":"/paper/2505.22045/citation-record.json","paper":"/paper/2505.22045"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.989978Z","title":"This task is applicable in ar- eas such as multimedia retrieval [2, 3], assistive technologies for the hearing-impaired [4, 5], and intelligent video analysis systems [6]","venue":null,"work_id":"8a8e7f99-5806-4ff6-adc6-7ca04f28430d","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:13.754361Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:42241f351ef00146cfa271242bd738e86ac0f438b30c2fcf22094fdda485914d","observation_id":"990bc393-2e2b-40b4-a080-f8d8f0809d60","resolution":{"observed_at":"2026-08-07T13:20:23.517742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.323570Z","title":null,"venue":null,"work_id":"38c04006-3164-4537-8dfd-09e2f3c631ad","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.270326Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:56baf15cb47ed4c5325b4dd099f4ac2ec0ff2ce849752d725865fafe953d45d9","observation_id":"c12670d2-e9e1-4c7c-a64b-51375d1c0e73","resolution":{"observed_at":"2026-08-07T13:20:22.382099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.158488Z","title":null,"venue":null,"work_id":"899d3c43-ea90-4fe4-996c-c03cc3e65b41","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.364911Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:91f3e628e9bcee6a29262a0c0d94d14fc4fd1f72cfb7172612728200027b3c87","observation_id":"90bc94fd-7a50-4db7-9b8f-084ecf204c51","resolution":{"observed_at":"2026-08-07T13:20:22.261447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.461269Z","title":null,"venue":null,"work_id":"d36b103a-ac7e-4b59-9a0f-b36694d70c8a","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.135637Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:1932b80066fae582b20d666bbb7e80b8c336dda33aca8998692e2a0594dea5e9","observation_id":"eb936e67-e883-4cf1-b057-e56dbc38e60f","resolution":{"observed_at":"2026-08-07T13:20:22.548312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.986668Z","title":"Video accessibility enhancement for hearing-impaired users,","venue":null,"work_id":"87b58a17-59db-4ca0-b06c-8cdbd05a58ac","year":2011},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.414743Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:866b1e0c30696ed7818ed267e684598c92871e5ed9926fd98f18a3c6ae30f25d","observation_id":"c793a1bb-f23e-46da-9739-496822bd745e","resolution":{"observed_at":"2026-08-07T13:20:21.105960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10002","last_updated":"2024-12-13T09:40:37Z","snapshot_observed_at":"2026-07-06T20:06:26.221438Z","submitted_at":"2024-12-13T09:40:37Z","title":"NowYouSee Me: Context-Aware Automatic Audio Description","version":1},"cited_work":{"arxiv_id":"2412.10002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10002","snapshot_observed_at":"2026-08-07T13:20:18.426408Z","title":"NowYouSee Me: Context-Aware Automatic Audio Description","venue":"cs.CV","work_id":"9ca5c962-52ef-4686-81b8-8658c472900c","year":2024},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.541739Z"},"links":{"cited_paper":"/paper/2412.10002","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:5365594442884925bf6a73846aa45ef42c30ad32273c6906b424e91853638370","observation_id":"e616a5a0-59cd-4e20-a11e-9eba3d580b2b","resolution":{"observed_at":"2026-08-07T13:20:18.566942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.979829Z","title":"Moreover, our system achieves an approximately 6x im- provement in inference speed compared to the baseline while still maintaining competitive accuracy","venue":null,"work_id":"4c19fb24-aaaf-4215-b25f-8ebf9a344dc9","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.457576Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:4a34095cf8a8c456d9b1f0e0a31839e043e65342bd3588dfdf0eac02b2612ad9","observation_id":"adbdb357-3523-47fe-8530-11cd4fb8af36","resolution":{"observed_at":"2026-08-07T13:20:22.071681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"cited_work":{"arxiv_id":"2505.22045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22045","snapshot_observed_at":"2026-08-07T13:20:19.500789Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","venue":"cs.MM","work_id":"59672561-b82e-40ef-ba06-f32d2abff6a0","year":2025},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.606479Z"},"links":{"cited_paper":"/paper/2505.22045","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:062debeec70d1c44645203d85a6841541634a26e50a5ef986839f39d70ea1831","observation_id":"5b3a8d93-2fb8-4921-ad48-6933a4507c29","resolution":{"observed_at":"2026-08-07T13:20:19.650775Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4730.6500","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.276356Z","title":"Experimental settings 3.1.1","venue":null,"work_id":"02948d7a-7149-41e2-a017-99cd073f76bf","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.730364Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:4f48937a1c393bbfc78f43057d5fe5ce9477a5b22324cd5b5d7ea44b05e08a81","observation_id":"0ae373ed-7693-4ab2-976d-0b72c193b6f2","resolution":{"observed_at":"2026-08-07T13:20:19.374002Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.685771Z","title":null,"venue":null,"work_id":"b36fff56-9f27-4eac-8729-cc1a3a8a4da3","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.866290Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:50b0c69b29fb7c1ee39764880318fe024d6153bdd9a10b8751e8eea189d31e2b","observation_id":"297b5d00-b720-40bf-9c6c-39e32e83f461","resolution":{"observed_at":"2026-08-07T13:20:21.860195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.497038Z","title":"Automated audio captioning: An overview of recent progress and new challenges,","venue":null,"work_id":"689956bc-f083-47f0-b4e1-4d3838a0e4e4","year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.990600Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:eb7b2182b1d9df2da971d5e71ee693937e426eedc6f53f9bd120131f340db875","observation_id":"7c8cc59d-b511-4993-8a1e-2c094d0b08db","resolution":{"observed_at":"2026-08-07T13:20:21.613178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.752477Z","title":"Building on this, LA VCap","venue":null,"work_id":"66a1ba5a-f489-43ec-a5be-0d283641267b","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:13.858742Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:aa769572b81bebc4be93d7ef65f99b5001afe77b192e7862c3a053702c6cebc8","observation_id":"bad65a29-c5d1-40ac-969d-888ac3c0dcfc","resolution":{"observed_at":"2026-08-07T13:20:22.840359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.630230Z","title":"V ACT [11] proposes an Adap- tive Audio-Visual Attention method that integrates audio and visual information through confidence scores derived from the †Corresponding author","venue":null,"work_id":"8a6d09a1-af28-4f67-90c0-f7e7c4e15510","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:13.995623Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:5f9631bcfe4c4111c0b7cf62f9672e209074c0451ba2e062d2fed8f789e69ed4","observation_id":"2f3c8141-f216-4f2f-8659-2f6409d76d98","resolution":{"observed_at":"2026-08-07T13:20:22.692869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15537","last_updated":"2022-06-30T10:53:15Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:18:50Z","title":"On Metric Learning for Audio-Text Cross-Modal Retrieval","version":3},"cited_work":{"arxiv_id":"2203.15537","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.15537","snapshot_observed_at":"2026-08-07T13:20:18.816681Z","title":"On Metric Learning for Audio-Text Cross-Modal Retrieval","venue":"eess.AS","work_id":"e6f02d62-6d80-4991-be1a-8ff94f900151","year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.102806Z"},"links":{"cited_paper":"/paper/2203.15537","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:99ecea9470dd85397298fa00b1e7695d0852c3867742a020f5bd6d12a65882f4","observation_id":"f26e6adf-f26c-431c-86e0-c3a924c667db","resolution":{"observed_at":"2026-08-07T13:20:18.957344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15147","last_updated":"2022-03-28T23:47:57Z","snapshot_observed_at":"2026-08-05T16:38:44.509543Z","submitted_at":"2022-03-28T23:47:57Z","title":"Separate What You Describe: Language-Queried Audio Source Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15147","snapshot_observed_at":"2026-08-07T13:20:15.203731Z","title":"Separate what you describe: Language-queried audio source separation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.203731Z"},"links":{"cited_paper":"/paper/2203.15147","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:cc46eda8bf43b98ba28497ea8697503e7ceb1e416f440fe12f1fa6eaf392351e","observation_id":"9197c34b-162e-4298-a2b0-d28ae0669ef7","resolution":{"observed_at":"2026-08-07T13:20:15.203731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.248970Z","title":"Dynamic captioning: video accessibility enhancement for hearing impair- ment,","venue":null,"work_id":"e916bd48-182b-4a97-845e-8fe5a5bac5f3","year":2010},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.338815Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:5339e0e9b088cd555fa07237170e08e4332f050b2ede0f8c3555313d2b97cb0c","observation_id":"0432c5c9-bbfb-4bac-a482-b5624e261675","resolution":{"observed_at":"2026-08-07T13:20:21.362097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09401","last_updated":"2025-06-01T07:01:51Z","snapshot_observed_at":"2026-08-09T10:18:54.006372Z","submitted_at":"2024-09-14T10:23:35Z","title":"Towards Diverse and Efficient Audio Captioning via Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09401","snapshot_observed_at":"2026-08-07T13:20:15.647051Z","title":"Towards diverse and efficient audio captioning via diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.647051Z"},"links":{"cited_paper":"/paper/2409.09401","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:1ee9b0078072e228a57aa719ca1b2a8ba1cda797b0a96637c661f530bf5dd72b","observation_id":"2e695f49-ffc9-48b4-9ca6-e94392156a0a","resolution":{"observed_at":"2026-08-07T13:20:15.647051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09817","last_updated":"2021-07-21T00:31:50Z","snapshot_observed_at":"2026-08-05T22:00:33.145653Z","submitted_at":"2021-07-21T00:31:50Z","title":"Audio Captioning Transformer","version":1},"cited_work":{"arxiv_id":"2107.09817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.09817","snapshot_observed_at":"2026-08-07T13:20:18.135780Z","title":"Audio Captioning Transformer","venue":"eess.AS","work_id":"c397f728-4970-4f02-a404-a534d0a580bb","year":2021},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.714734Z"},"links":{"cited_paper":"/paper/2107.09817","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:3606f9a6108d73fc1f256455c1303e137ba839a32e74f98c1d3d37f16d42cdb0","observation_id":"b8e6e2e4-5745-481d-abaa-bceab90c8304","resolution":{"observed_at":"2026-08-07T13:20:18.267155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:15.853445Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.853445Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:13bc6d5e49d09a18fc7f37300009233f4f891753a68db83b959f1cc210e8fbad","observation_id":"50ab83a6-bbc2-48ba-a227-606ea4b0012f","resolution":{"observed_at":"2026-08-07T13:20:15.853445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13275","last_updated":"2024-06-25T08:07:36Z","snapshot_observed_at":"2026-07-06T18:33:28.511600Z","submitted_at":"2024-06-19T07:09:46Z","title":"Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding","version":2},"cited_work":{"arxiv_id":"2406.13275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13275","snapshot_observed_at":"2026-08-07T13:20:17.952996Z","title":"Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding","venue":"cs.SD","work_id":"bc3bb14c-d932-4282-8466-1f0deef86ac7","year":2024},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.968878Z"},"links":{"cited_paper":"/paper/2406.13275","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:752c4f1da972ab73d00827ed02d7889698de6d01179c3723300a50e3fd6ae562","observation_id":"987c54b5-ee94-4442-89d2-239d455eff1a","resolution":{"observed_at":"2026-08-07T13:20:18.006011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16428","last_updated":"2023-05-29T03:53:01Z","snapshot_observed_at":"2026-07-06T14:11:55.178649Z","submitted_at":"2022-10-28T22:45:41Z","title":"Visually-Aware Audio Captioning With Adaptive Audio-Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16428","snapshot_observed_at":"2026-08-07T13:20:16.007613Z","title":"Visually-aware audio captioning with adaptive audio-visual attention,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.007613Z"},"links":{"cited_paper":"/paper/2210.16428","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:4501ec5d98ef6a53e5bd44a4d1242900f49a3120a3e1b0a8a516e90155018d65","observation_id":"829b6f68-f844-45d7-90b6-2c9c107b8d66","resolution":{"observed_at":"2026-08-07T13:20:16.007613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.804759Z","title":"Avcap: Leveraging audio-visual fea- tures as text tokens for captioning,","venue":null,"work_id":"a6c18d96-87b0-4365-a327-35456aaff485","year":2024},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.098663Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:e2ce21316328faabfae1812c5e4aedda422c28a940f31c9b4f14791d9aec1e1a","observation_id":"8b570a96-c39e-45dc-82f4-d53d388ce3bd","resolution":{"observed_at":"2026-08-07T13:20:20.844151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-09T18:53:22.800809Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-08-07T13:20:16.225698Z","title":"Lavcap: Llm-based audio-visual captioning using optimal transport,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.225698Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:977022fd5a90f4fc26d925fbc1406780cc9d8724ca7a6e9b4ab31b2234fd7223","observation_id":"21c84687-edff-4251-a172-5b1d6519ca57","resolution":{"observed_at":"2026-08-07T13:20:16.225698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.407539Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.407539Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:4fef689732d77a738384ce406fe0ceaf177aaee1b3fd26c565fb617c2205e646","observation_id":"db42c618-b50c-44eb-af32-601868dfd147","resolution":{"observed_at":"2026-08-07T13:20:16.407539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-10T01:58:32.784453Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-07T13:20:16.505610Z","title":"Contrastive audio-visual masked au- toencoder,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.505610Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:41d9564650aef43045f48523cf25eddada1291beac877780ff7d0d3e0e774332","observation_id":"4b5530ac-5d7b-4943-9ce5-9a3b7aae252e","resolution":{"observed_at":"2026-08-07T13:20:16.505610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T13:20:16.676736Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.676736Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:8548271729359b528b74564911a16d8759a2f0e558ed7fe71de8d4a40f8c7b3b","observation_id":"c03b655d-b14e-4e42-ba09-491c1f051c61","resolution":{"observed_at":"2026-08-07T13:20:16.676736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.761687Z","title":"Audiocaps: Generat- ing captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.761687Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:6d8c1949e210fc0c227a2698941313ae2f4d22c17a3503d8ebe85abb3778c7c0","observation_id":"77c30047-e1f8-4dba-9d37-5b52cef44cf0","resolution":{"observed_at":"2026-08-07T13:20:16.761687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.839969Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.839969Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:1e8e611b4e40baab9d18263aeb54b72a05bf8c20452c0bd486d3a6f00d77246e","observation_id":"9c36b8df-cb5c-41bb-95a2-5e1fb082b908","resolution":{"observed_at":"2026-08-07T13:20:16.839969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.934236Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.934236Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:6c0d0fb0f370f2bbb9ad7d89ebddffb1fb0bc0b734f3695478195ecd7aee0fb3","observation_id":"bec60f63-820b-4a4f-aea3-fb6c780ad572","resolution":{"observed_at":"2026-08-07T13:20:16.934236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.172488Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.172488Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:29bb9e84ce4019a049783e0d546f66c29d889fbfd31bcb76d44e50c61e7c525c","observation_id":"5a72782a-6566-4ddb-884c-0e8661853b19","resolution":{"observed_at":"2026-08-07T13:20:17.172488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.246884Z","title":"Rouge: A package for automatic evaluation of sum- maries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.246884Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:40c77bcdf418c971eafe005f5b89bc7ac03b8685d2261dab983bbdcec253a699","observation_id":"685df9f8-685a-4bf1-9b69-598c1c271207","resolution":{"observed_at":"2026-08-07T13:20:17.246884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.560719Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":"2deeea88-3cdb-40b9-9e00-1750bf44b27d","year":2015},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.364740Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:96c57ffdfeb9e590f3715668e1f0fe6756816c43fa920ff65f8e6907a8010ba8","observation_id":"bf2ab7b3-ee15-491a-922a-ec8ebbf9222e","resolution":{"observed_at":"2026-08-07T13:20:20.685683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.316261Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"64fa121e-9979-4beb-855c-888c1f69025e","year":2016},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.461337Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:d67a0b76cabc740ff7c12fbd7aacb0a726133c6f1c6550f93bbea45bf4ad5e2e","observation_id":"fbc936b4-d313-491e-9f1a-439a4feb4b53","resolution":{"observed_at":"2026-08-07T13:20:20.419907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.055599Z","title":"Improved image captioning via policy gradient optimization of spider,","venue":null,"work_id":"361b44e4-3a02-4d90-9bf4-186754e60ee5","year":2017},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.534077Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:620b519e603fecb8da54582689b6593fd1eddd45d87af762e8c4e6cdd3dc7c84","observation_id":"62b9ede9-917c-48ea-a188-2d2857d12da9","resolution":{"observed_at":"2026-08-07T13:20:20.172010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.795920Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"5e644225-17bf-439a-94a1-f78bac0d8fe2","year":2014},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.616572Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:b5995c6eb0f7ea0db09693a70a9f9a0085b8394d73bb68da66118fd6bba4524c","observation_id":"32c864e5-d2ad-45be-96cf-e0ad68300752","resolution":{"observed_at":"2026-08-07T13:20:19.936515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":5,"verified_fuzzy":12},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2505.22045."}