{"as_of":"2026-08-15T20:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08e133d5ac2364055c3f6b16cc8f64b26c46f3855b2b7df9eda1fcb442527e8c","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:52:43.674756Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:52:38.024169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:52:44.372937Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"cited_work":{"arxiv_id":"2505.23308","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23308","snapshot_observed_at":"2026-08-07T12:52:44.372937Z","title":"Spoken question answering for visual queries","venue":"eess.AS","work_id":"d785a1d5-e6be-4470-a74f-a88ea9e06bda","year":2025},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.024169Z"},"links":{"cited_paper":"/paper/2505.23308","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:836140120ced606b4fcd1d49b98fba166704bbf20a24b127894764a64ab3354e","observation_id":"e2364817-5c38-4f32-9a3e-9b8f8f5f8f4d","resolution":{"observed_at":"2026-08-07T12:52:44.527282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23308/citation-record","integrity":"/paper/2505.23308/integrity","json":"/paper/2505.23308/citation-record.json","paper":"/paper/2505.23308"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"cited_work":{"arxiv_id":"2505.23308","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23308","snapshot_observed_at":"2026-08-07T12:52:44.372937Z","title":"Spoken question answering for visual queries","venue":"eess.AS","work_id":"d785a1d5-e6be-4470-a74f-a88ea9e06bda","year":2025},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.024169Z"},"links":{"cited_paper":"/paper/2505.23308","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:836140120ced606b4fcd1d49b98fba166704bbf20a24b127894764a64ab3354e","observation_id":"e2364817-5c38-4f32-9a3e-9b8f8f5f8f4d","resolution":{"observed_at":"2026-08-07T12:52:44.527282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.769317Z","title":null,"venue":null,"work_id":"111081eb-2608-4f21-8886-7a99ac1aab47","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.089468Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:a4dd53c2f1f2feea2075dd5b110242fcd4c9e1688c13f5eacc2deb174205d9b1","observation_id":"e16c0d6f-5043-429f-a446-3ff63f51e23a","resolution":{"observed_at":"2026-08-07T12:52:51.843899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.529977Z","title":null,"venue":null,"work_id":"34edcaf6-5888-4802-ba1a-88a0bbaf1d10","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.157075Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:33f77a4409e6747ed1a3c95503cd618a84cf1414fb69cd94ad32e21f2954a10c","observation_id":"e98c7758-57d8-4dc9-a039-69fc9a872a89","resolution":{"observed_at":"2026-08-07T12:52:51.668743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.360110Z","title":null,"venue":null,"work_id":"4c2f18b7-33c2-46f0-8a1c-a251bca7b824","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.272015Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:9b867c64fedc7282737c45c42ff3b11c5f8d8defaf155027b485b5dde73ff60b","observation_id":"f7ce5fa8-0945-466d-b639-8338190f1428","resolution":{"observed_at":"2026-08-07T12:52:51.427848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.184296Z","title":null,"venue":null,"work_id":"e36681ff-fc9e-4dce-ab7b-d662a84bd8f2","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.368166Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:828e7edf4432912fcd6eca5af0ef2eefe3ab5d9c3e02bb0ef4b9fe81aeacc735","observation_id":"6c1e6c72-a674-4861-9221-bfa2c5fb12ac","resolution":{"observed_at":"2026-08-07T12:52:51.237876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.024148Z","title":"Visual question answering (VQA) attempts to describe, locate, and reason regarding some visual input [9, 10, 11]","venue":null,"work_id":"b73104d2-b8ce-4d29-a58f-0b79c06af7d6","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.452799Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:4e37b63dc938f65699974e33d2508c130d7fcedeb98827b49ea0f5827ff5cc52","observation_id":"32026afa-0ceb-47f6-9fe5-46071c63018c","resolution":{"observed_at":"2026-08-07T12:52:51.107308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.827292Z","title":"The LLaV A model extends a text-based, generative, large language model (LLM) for visual question answering (VQA) by allow- ing visual information input from images","venue":null,"work_id":"6a328877-2eaf-44f1-833e-516b7c4844b5","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.531846Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:381fe8f3e1593c62e36c5c07560a8a5b1a5efc8b36031032d9a4931eb7fcd25a","observation_id":"d34e2aa7-ba44-486e-8560-b63ff416c30f","resolution":{"observed_at":"2026-08-07T12:52:50.892877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.649887Z","title":"Speech-only datasets We pre-train the speech projector using the English subset of Multilingual LibriSpeech (MLS) [29]","venue":null,"work_id":"12136d9e-c0a2-4175-8154-a30931d0fe81","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.603024Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:4515599144d7d61810171d79de99a818ef065e3af415292d37de2977d08f6c6c","observation_id":"b17d589f-2748-428b-a728-039fae1af24f","resolution":{"observed_at":"2026-08-07T12:52:50.734359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.456265Z","title":"The speech tower is composed of a trained Whis- per encoder2 and a speech projector","venue":null,"work_id":"0c8c3709-fb13-4d00-8323-595635eeb4ee","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.689074Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:b36b54c4df096f9523cb8280631a25e2aed31ca9092eeb96cec2fa3a2b0ba909","observation_id":"daf03e84-b161-4e47-9b23-0e1840adce69","resolution":{"observed_at":"2026-08-07T12:52:50.528588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.273196Z","title":"Spoken VQA Table 1: Performance across VQA benchmarks (StyleTTS2 / F5-TTS)","venue":null,"work_id":"9043dc9a-3fd7-4aca-9edd-52726c8a1d7b","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.759945Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:aea9ba8e7f6b3ad078d7a14bcec0fc8e0c4bdf34abf81eb03269e864dcd203fb","observation_id":"e1caa170-4215-4589-bb19-ebc6eb4e0e7c","resolution":{"observed_at":"2026-08-07T12:52:50.360688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.060915Z","title":"In contrast, our SVQA approach maintains more robust performance across all bench- marks","venue":null,"work_id":"f0a8f44f-8e2d-4701-9e58-2b53c26edd3d","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.839356Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:09e4cc10c2ac322d7780148083b0dd37c863ab7e9f96ce2270d02ae180b50d46","observation_id":"402bd894-ee0f-423a-bb1f-48265960ac09","resolution":{"observed_at":"2026-08-07T12:52:50.146588Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.860869Z","title":"A significant portion of the effort was spent on building both the speech and SVQA datasets","venue":null,"work_id":"5815f2de-76bc-4a33-b06c-7692f0ccbe32","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.904415Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:0f65bdd680aea412ca5ba3f2f41c425c1fe89a5652981b48b33e980a2e0a9a61","observation_id":"aac2e1eb-c748-44a4-8e75-9009deab37aa","resolution":{"observed_at":"2026-08-07T12:52:49.940924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.679462Z","title":"VQA: Visual question an- swering,","venue":null,"work_id":"8c51f7f1-3ea8-49b0-aeeb-07e577858d59","year":2015},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.016333Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:5e8d2b931ef114aaf5f95694c50dce49e2214d23ab2eb0512167f5fea924a9b4","observation_id":"dfb14b90-ce57-4463-a04f-2c314bba2a29","resolution":{"observed_at":"2026-08-07T12:52:49.760777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.451311Z","title":"High-resolution im- age synthesis with latent diffusion models,","venue":null,"work_id":"873da907-127c-4657-a5b2-10409700e3ad","year":2022},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.103424Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:477e8f9dc7430063f776b7115fe0cf7d0f0c69a0940e44f9454b477d0b83ff09","observation_id":"d00fa8da-edb2-4a53-b44e-11a9bdcf7428","resolution":{"observed_at":"2026-08-07T12:52:49.519865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11559","last_updated":"2020-08-11T05:48:36Z","snapshot_observed_at":"2026-07-06T08:32:11.354477Z","submitted_at":"2019-10-25T07:46:39Z","title":"SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11559","snapshot_observed_at":"2026-08-07T12:52:39.184008Z","title":"SpeechBERT: An audio-and-text jointly learned language model for end-to-end spoken question answering,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.184008Z"},"links":{"cited_paper":"/paper/1910.11559","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:9d7c162aaf320f49ac2c0101dd6b628f257b7955071bcb12acc7231e03bad994","observation_id":"f26246e6-ec86-4efd-a0b7-f86657cc9403","resolution":{"observed_at":"2026-08-07T12:52:39.184008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T12:52:39.261148Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.261148Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:455fdc3e8f1610e43af85007973b2f5fcdeb94f8deedb84e7b88db9f8adf949c","observation_id":"dca87ffb-0cc6-4a61-848e-5732005e753e","resolution":{"observed_at":"2026-08-07T12:52:39.261148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07691","last_updated":"2023-11-20T04:23:08Z","snapshot_observed_at":"2026-08-13T11:18:17.359420Z","submitted_at":"2023-06-13T11:04:43Z","title":"StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07691","snapshot_observed_at":"2026-08-07T12:52:39.339674Z","title":"StyleTTS 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.339674Z"},"links":{"cited_paper":"/paper/2306.07691","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:367bfc311e7d60dc0df3fa99fef4248635729aa003a5c7cab126d1bafd3b5495","observation_id":"b54c6fbb-5bc7-4da3-bc43-931e77ecb537","resolution":{"observed_at":"2026-08-07T12:52:39.339674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.434164Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.434164Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:426ecbcafb5bc5875aaa3abb674839a526b5758420df88dc27448b3cfca6dc02","observation_id":"66d0b38f-ad84-4dd7-a47f-a1bcbaed0e42","resolution":{"observed_at":"2026-08-07T12:52:39.434164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.186513Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"714018fc-dfbd-474a-966e-c676776626a8","year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.518167Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:887d2f529ab329f85b835d06660eb7259daf8f3ab5ffa2df93953db60e90c229","observation_id":"9dc4346d-99e6-414a-9ab1-51eae3e941cc","resolution":{"observed_at":"2026-08-07T12:52:49.312406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.012045Z","title":"Learning transfer- able visual models from natural language supervision,","venue":null,"work_id":"886f834a-e289-42d4-ac48-ac42c56ea0f3","year":2021},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.600112Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:e842442b3581e0c8971e4425cbcf05a954754fed77b4c9545044ebfe6475b746","observation_id":"d241ecdc-97ca-49f4-8f74-926cf05ecb10","resolution":{"observed_at":"2026-08-07T12:52:49.088898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T12:52:39.686996Z","title":"SEED- Bench: Benchmarking multimodal LLMs with generative comprehension,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.686996Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:f681ceee7ba422af27b37595cc07315112b11d3c7ba1db712ea86927923773f4","observation_id":"b1cab28e-55cb-48d0-9876-287a93bd654d","resolution":{"observed_at":"2026-08-07T12:52:39.686996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.815338Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.815338Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:4d35fff0505cfad666fbff70a4969e98cd2e3ffdb75869bfc768da3c58d8313f","observation_id":"0fb653b5-e2d5-44a1-bb91-c6310593af24","resolution":{"observed_at":"2026-08-07T12:52:39.815338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-15T00:38:08.150895Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-07T12:52:39.942212Z","title":"DocVQA: A dataset for VQA on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.942212Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:156df7b65921d17c33df28ede8ab435c2944e5d9f415d2e5783a91de656515b3","observation_id":"eab244cd-062d-451b-91ab-aaaca92a01da","resolution":{"observed_at":"2026-08-07T12:52:39.942212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:48.780834Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"241b782e-93c7-40b9-9971-913fca2dc8f9","year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.084560Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:eed902336d79e84cefa86d1a2df11ce986c4e7e7e0d637d8774af0fe52db5929","observation_id":"e2429511-7ddb-47df-bf4e-720dd644097f","resolution":{"observed_at":"2026-08-07T12:52:48.899988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09927","last_updated":"2025-02-14T05:36:32Z","snapshot_observed_at":"2026-08-10T18:50:32.127116Z","submitted_at":"2025-02-14T05:36:32Z","title":"Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09927","snapshot_observed_at":"2026-08-07T12:52:40.237406Z","title":"Granite vision: a lightweight, open-source multimodal model for enterprise intelligence,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.237406Z"},"links":{"cited_paper":"/paper/2502.09927","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:ce1952dfaf6c1f8b1a5c69e2c83bbe84f15fc7e70be718668e3bd19cdb3c5b3a","observation_id":"43c74d66-fa83-43ee-8e5b-9c61634e3c33","resolution":{"observed_at":"2026-08-07T12:52:40.237406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-07T12:52:40.386603Z","title":"InternLM-XComposer2: Mastering free-form text-image composition and comprehension in vision- language large model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.386603Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:5f3609e4e63cb1fa72da231b4ada0f44d5d9c5a4d3958e0c53e221f58014a2d9","observation_id":"d6a24705-9081-43f9-8feb-ba7381aef310","resolution":{"observed_at":"2026-08-07T12:52:40.386603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:48.509662Z","title":"ODSQA: Open-domain spoken question answering dataset,","venue":null,"work_id":"3ab00dfb-21e2-478f-be3a-d0da281c8aed","year":2018},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.471458Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:c22f871b117d571f122103c7ae0a9de0c70d7b930914e461fef2f5a408174ad2","observation_id":"db54811b-25ba-4edd-babb-f58e6c2e0749","resolution":{"observed_at":"2026-08-07T12:52:48.659526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:48.323570Z","title":"Knowledge distillation for im- proved accuracy in spoken question answering,","venue":null,"work_id":"f84fb2e7-8dca-4f44-8013-8f46b39272e9","year":2021},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.598190Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:d08cb5b6d69f6120d321325307ef78702169bf1ccb1e185e67585f0fdc29a71d","observation_id":"c53e8183-b2c1-4fd3-9d36-d0a2e942df39","resolution":{"observed_at":"2026-08-07T12:52:48.399122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.00464","last_updated":"2017-09-16T03:43:20Z","snapshot_observed_at":"2026-08-14T21:03:41.365587Z","submitted_at":"2017-05-01T10:43:28Z","title":"Speech-Based Visual Question Answering","version":2},"cited_work":{"arxiv_id":"1705.00464","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.00464","snapshot_observed_at":"2026-08-07T12:52:43.962125Z","title":"Speech-Based Visual Question Answering","venue":"cs.CL","work_id":"fc9e22aa-4f7e-468d-af53-1dbaf27d0046","year":2017},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.748552Z"},"links":{"cited_paper":"/paper/1705.00464","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:12f4b8b27039402c0e2196a5624c4f864a03e1a8381e203504d91aba1c99b309","observation_id":"ba7b729c-8fa8-4793-9af5-3f73d883dccf","resolution":{"observed_at":"2026-08-07T12:52:44.095480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:48.079080Z","title":"Speech enabled visual question answering using lstm and cnn with real time image cap- turing for assisting the visually impaired,","venue":null,"work_id":"cf5daff6-e8da-4356-8c05-f0533f35f983","year":2019},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.913421Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:f89029b5c56e4153f04fd21de4297149454039daac9353130a94e7aa21e06f90","observation_id":"9d6b1bd0-aec0-4881-b7d8-a5df58d4d206","resolution":{"observed_at":"2026-08-07T12:52:48.150661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.941334Z","title":"SBVQA 2.0: Robust end-to- end speech-based visual question answering for open-ended ques- tions,","venue":null,"work_id":"8e95d16c-cde6-4ee0-8887-381bd1191ee1","year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.044499Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:1be59c36bdd0b8afc330dc3bc75768db2bcbd0c3cd238492247964e523212e14","observation_id":"0d1b5061-1f20-4e3b-b5a6-47840979a600","resolution":{"observed_at":"2026-08-07T12:52:48.009869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.673006Z","title":"Towards mul- tilingual spoken visual question answering system using cross- attention,","venue":null,"work_id":"11dbef58-c935-4d39-961d-970865949877","year":2025},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.156832Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:8f7287155b44e404dc9dd1c97e0c8ff4fa863b58d0f5e4489f3a32b7d9aac54e","observation_id":"1f162e18-2bc9-428d-abbe-8ce339d27fe6","resolution":{"observed_at":"2026-08-07T12:52:47.807587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.431889Z","title":"Worldly wise (WoW)-cross-lingual knowledge fusion for fact- based visual spoken-question answering,","venue":null,"work_id":"336523b7-ee0f-49be-abdd-9e2246cc80ed","year":2021},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.243290Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:0a91aa716d8903830706fef3532c91a109c7388b18c6286de0529f49ddab00d4","observation_id":"c5d0ba00-5fa7-4ee4-9981-303085796e8c","resolution":{"observed_at":"2026-08-07T12:52:47.550425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11383","last_updated":"2024-07-16T04:54:45Z","snapshot_observed_at":"2026-08-12T23:21:27.488164Z","submitted_at":"2024-07-16T04:54:45Z","title":"TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11383","snapshot_observed_at":"2026-08-07T12:52:41.348522Z","title":"TM-PATHVQA: 90000+ textless multilingual questions for medical visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.348522Z"},"links":{"cited_paper":"/paper/2407.11383","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:215e3207cfec8c0d9c2558388ded851c0b84dc8c58effd7d0b64b3541688ae16","observation_id":"14fae85c-4120-49c6-870a-95df08d854c9","resolution":{"observed_at":"2026-08-07T12:52:41.348522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.197463Z","title":"A VQA: A dataset for audio- visual question answering on videos,","venue":null,"work_id":"1f4a847b-689d-4b78-83e5-359f57a34c8b","year":2022},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.478609Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:7bdfee5e89fced36e30a1a6098a77a3a3a5d19f2bbfb767105507536e268ac92","observation_id":"c0b80d85-8099-4cdf-b2c6-39320697d568","resolution":{"observed_at":"2026-08-07T12:52:47.291482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.876270Z","title":"Learning to answer questions in dynamic audio-visual scenarios,","venue":null,"work_id":"63f7c0c0-0ed1-455c-bc0c-b5a43573ad1e","year":2022},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.621202Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:e66f4a791261f0b4f82b5835fa41311ca105cb5f58c19c920818af3a4d4b8874","observation_id":"278c41cd-6374-44c3-a969-53654ded78c9","resolution":{"observed_at":"2026-08-07T12:52:46.993375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.570895Z","title":"Progressive spatio-temporal percep- tion for audio-visual question answering,","venue":null,"work_id":"47e23420-559f-42ec-937b-f4f581337c09","year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.738830Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:bcdf20a9b565a78f5951965b4d1501e7c998701b673e1064755300c64aefc23c","observation_id":"537a3244-d81f-40bc-babc-72a33d79e69a","resolution":{"observed_at":"2026-08-07T12:52:46.750107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.285700Z","title":"TVLT: Textless vision- language transformer,","venue":null,"work_id":"5b08a8c0-20a0-48a6-a364-26e2756a47ac","year":2022},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.863793Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:51dabe42c55f89e36a1df85fbf6ac091bcb5db49115da3009a141f3d9d16c55f","observation_id":"73056d27-3b80-4814-b56a-257c3235605d","resolution":{"observed_at":"2026-08-07T12:52:46.445785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.964826Z","title":"Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality,","venue":null,"work_id":"eb14b567-a0ae-447e-b9e0-fadbe069f901","year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.936684Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:b583c7e323daad87ca44efacfc51a06081cb9a5245e2bfe05935a0ac96fc2c23","observation_id":"515ba5d2-a398-4411-8afa-99b8b4d4ddc1","resolution":{"observed_at":"2026-08-07T12:52:46.101046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-07T12:52:42.077607Z","title":"Judging LLM-as-a-judge with MT-Bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.077607Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:23be5e1e83efdd2a2aa0c59b76e1fc3a5c3180b4662afa1dfb494d33fbacc079","observation_id":"b9aedd00-dd34-4376-aa4c-1946c8e6ac56","resolution":{"observed_at":"2026-08-07T12:52:42.077607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:42.260823Z","title":"MLS: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.260823Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:2ab391c4e41091ed865eb464125df64b016b7077e9ec19d693376b492ca4005b","observation_id":"56bcec15-253a-4c0d-820d-17811f98918c","resolution":{"observed_at":"2026-08-07T12:52:42.260823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.765233Z","title":"Audiochatllama: Towards general- purpose speech abilities for llms,","venue":null,"work_id":"c2570c06-da8e-4698-8a87-532afd602946","year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.415832Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:fe630426d0393f1526a47e8ed97c5ae8ffc0272fa07209364bbbf88dc8a4e6e2","observation_id":"f591dbd1-ebf9-4229-94fb-c5ccde3f1f31","resolution":{"observed_at":"2026-08-07T12:52:45.867320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-14T05:56:43.101287Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-07T12:52:42.565008Z","title":"What matters when building vision-language models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.565008Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:96eaffc33013ea1a1f048282b817a27cea14719764493555f6b2685fdc581bb2","observation_id":"cd6a42c2-5666-4106-8643-858b0e82fd13","resolution":{"observed_at":"2026-08-07T12:52:42.565008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T12:52:42.746933Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.746933Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:57700a86398f7af7867dce704c57384f8c74b5ab5fbaa1650e24955e5a7bb893","observation_id":"6a796c9b-cd70-41d0-8014-5d5d7a4ca622","resolution":{"observed_at":"2026-08-07T12:52:42.746933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.487062Z","title":"Spoken SQuAD: A study of mitigating the impact of speech recognition errors on listening comprehension,","venue":null,"work_id":"77bbf8a7-664e-4001-8033-032fba618d29","year":2018},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.904080Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:72fd7f9d08f45706d01206186eda2d38bf577d0d7a26cdd56d0683ac553b3c86","observation_id":"ca0c7e0d-86b8-4faf-bfbd-f43cdbcb87f0","resolution":{"observed_at":"2026-08-07T12:52:45.627436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.261417Z","title":"HeySQuAD: A spoken question answering dataset,","venue":null,"work_id":"21c37ac8-728f-4d64-9fc4-1d25a97ffee2","year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.080957Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:bcb6058e661b240c8dbf406a7f5fde309d1fe67a73fcafb4a03736eabb5d5a53","observation_id":"a79f3414-e36a-4df3-ac53-d17663845828","resolution":{"observed_at":"2026-08-07T12:52:45.323528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T12:52:43.292481Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.292481Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:f4b60ca424b738cf4cf8b7bd1a0a3a3cf15ccfad37b9b63b4e59faa5b90be30e","observation_id":"7bca26dc-174e-4c7e-b9df-abc2fbcf768b","resolution":{"observed_at":"2026-08-07T12:52:43.292481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T12:52:43.377377Z","title":"LMMs-Eval: Reality check on the evaluation of large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.377377Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:04b2eb744c082f6e52cf9a68ca1e24add5220c6508650307b88cc9555be7b612","observation_id":"c1de9b23-f463-4c5c-a580-d41614ee40de","resolution":{"observed_at":"2026-08-07T12:52:43.377377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.963066Z","title":"LMMs-Eval: Accelerating the development of large multimoal models,","venue":null,"work_id":"c0f1ec8c-206f-483d-92b0-21817e9c1f70","year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.503710Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:7d8fbaf0565653243ffd8d47b88ac9f328c7765f94f065acd9d13e18fd38eb0f","observation_id":"c9995415-57b8-4887-aa51-105d8f1371d9","resolution":{"observed_at":"2026-08-07T12:52:45.093170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.683327Z","title":"Your general opinion on the paper should be positive","venue":null,"work_id":"14f41bea-496b-4c6e-a14a-12768af252ef","year":null},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.674756Z"},"links":{"citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:5ce95bda61637dc0e2ca345730debfbe4cfd458e6a1cc7f62e81946fe24cb4f9","observation_id":"8ac98437-f6cd-486a-b929-107ca812e6fe","resolution":{"observed_at":"2026-08-07T12:52:44.830579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-14T22:38:46.150410Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2505.23308."}