{"as_of":"2026-08-09T21:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87e66b43ed03623b4429127d250f916681efba60224001161997757b7d68a2b9","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:30:26.374735Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21755/citation-record","integrity":"/paper/2505.21755/integrity","json":"/paper/2505.21755/citation-record.json","paper":"/paper/2505.21755"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.381515Z","title":"To- wards Causal VQA: Revealing and Reducing Spurious Cor- relations by Invariant and Covariant Semantic Editing","venue":null,"work_id":"d5d4398f-6951-4b78-9cee-6a61dc55b09f","year":2020},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.018950Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:8e2c17167f3439bfaf5744002686bf4c9146698dcaee719508372b82f23ab2e1","observation_id":"99298249-d5ce-4d24-b7ed-7a2ec893d70d","resolution":{"observed_at":"2026-08-07T13:30:36.480682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00377","last_updated":"2018-06-03T15:32:06Z","snapshot_observed_at":"2026-08-02T15:53:30.552107Z","submitted_at":"2017-12-01T15:48:50Z","title":"Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00377","snapshot_observed_at":"2026-08-07T13:30:19.101688Z","title":"Don’t Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.101688Z"},"links":{"cited_paper":"/paper/1712.00377","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:0e3267ac961952dbce782d5797d4f01606a0a1b785ca7c5d42a8facec34d8b4d","observation_id":"7c3886df-9f77-4bec-8bf0-cc141573074c","resolution":{"observed_at":"2026-08-07T13:30:19.101688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12191","last_updated":"2023-04-01T07:07:44Z","snapshot_observed_at":"2026-08-09T07:05:42.971387Z","submitted_at":"2022-05-24T16:44:45Z","title":"Reassessing Evaluation Practices in Visual Question Answering: A Case Study on Out-of-Distribution Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12191","snapshot_observed_at":"2026-08-07T13:30:19.222653Z","title":"Reassessing Evaluation Practices in Visual Ques- tion Answering: A Case Study on Out-of-Distribution Gen- eralization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.222653Z"},"links":{"cited_paper":"/paper/2205.12191","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:db642a8ffb85e50b9d0f004ec73f9dc8ed1698276661eef3fe3727867a11c8e0","observation_id":"6ad4b3af-339d-4ff5-854f-99457823b23a","resolution":{"observed_at":"2026-08-07T13:30:19.222653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T13:30:19.360656Z","title":"PaliGemma: A versatile 3B VLM for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.360656Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:d4efa70d1df706d14b8ecf0e10dd4df7724be510144dbd440a8547d793d167e3","observation_id":"4e779346-0c0d-4320-95e4-07b7788f6653","resolution":{"observed_at":"2026-08-07T13:30:19.360656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.145316Z","title":"Cunningham","venue":null,"work_id":"0e4e168b-ffcf-4660-8095-1e569812d30e","year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.440154Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:d3f552760849b13206e49876538299cfedfeb3b75290daf0ac04efe4ab436868","observation_id":"9ebf6be0-401f-4a07-97d5-2046c39be37b","resolution":{"observed_at":"2026-08-07T13:30:36.279981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.969357Z","title":"VizWiz: nearly real-time answers to visual questions","venue":null,"work_id":"7beab5e4-4828-4210-81ea-56ccb329cb5d","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.536741Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:7e3643743b8545967ac0276b386cf203f809e1da778dd4b28cfacbb9800acfd9","observation_id":"8ba14324-63cd-4c7b-a137-3ebabc3d09e7","resolution":{"observed_at":"2026-08-07T13:30:36.028569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.779809Z","title":"Behind the scene: Revealing the secrets of pre-trained vision-and-language models, 2020","venue":null,"work_id":"992f8384-97ee-4619-9c54-0f28816e7e72","year":2020},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.664338Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:6b3f1f17b9632a95a187d7a4334858718bf53076e698d6c540996bcb1f57c8f2","observation_id":"e50859f1-9e25-4f6f-b1d8-9dbd59188da5","resolution":{"observed_at":"2026-08-07T13:30:35.887545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.679294Z","title":"Benchmarking robustness of adaptation methods on pre-trained vision-language models, 2023","venue":null,"work_id":"86fcd856-7577-4ed1-8176-dce86c445267","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.809894Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:aa7c8939a8d458bbc6fab2f204caf32d3a354305047509e76dd667bf3931de6b","observation_id":"77e73c75-bb3d-49f4-b248-701bdd331e89","resolution":{"observed_at":"2026-08-07T13:30:35.718142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03149","last_updated":"2021-09-01T09:11:58Z","snapshot_observed_at":"2026-07-06T10:57:17.838513Z","submitted_at":"2021-04-07T14:28:22Z","title":"Beyond Question-Based Biases: Assessing Multimodal Shortcut Learning in Visual Question Answering","version":3},"cited_work":{"arxiv_id":"2104.03149","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.03149","snapshot_observed_at":"2026-08-07T13:30:28.621167Z","title":"Beyond Question-Based Biases: Assessing Multimodal Shortcut Learning in Visual Question Answering","venue":"cs.CV","work_id":"6a34afb7-0e52-4ea7-8ad1-c18ee0f6ffc0","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.956939Z"},"links":{"cited_paper":"/paper/2104.03149","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:94c59b7e826d2ef0c30c956a5e6a737d3f76161d7b0475ac76e6ec6d8246d8ed","observation_id":"44971840-6caa-4117-abe1-8330f81867b9","resolution":{"observed_at":"2026-08-07T13:30:28.679257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.478192Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"35fcde6e-16fc-4c37-9e06-dc3718abdbda","year":2009},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.044752Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:8e8f713cbf7ae3c1c4c67534b460d36d368f94e85da299cd8557574fc56354a9","observation_id":"c0f29e56-f5ff-4e9f-b049-7c03a6c03f70","resolution":{"observed_at":"2026-08-07T13:30:35.581963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:20.156174Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.156174Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:f907ae565ad5ebdf1c1034345432a24c163f50bdc88cd577caaed11260a03510","observation_id":"aea9155f-6a9a-4985-9e7e-b5502aed4e13","resolution":{"observed_at":"2026-08-07T13:30:20.156174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.246061Z","title":null,"venue":null,"work_id":"019a4e9e-af86-4579-bcbf-11eabb82a885","year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.272974Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:7f2b5ecc73808c40fccd86e8337e2a9ead3aeffb0ba5256f59934f6daa768a30","observation_id":"82cba0ee-3bdf-4bd5-9d4b-0a5e2146c87a","resolution":{"observed_at":"2026-08-07T13:30:35.329020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:20.442632Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.442632Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:f8da1ef8ffa85aac67fbc6bbc2ba564ac3d929c0d2b0ba9d0795278b04935ddb","observation_id":"10ed4b95-718c-4c46-8997-a868a8d4c553","resolution":{"observed_at":"2026-08-07T13:30:20.442632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.082993Z","title":"Ex- ploring the limits of out-of-distribution detection, 2021","venue":null,"work_id":"eb5ea0b1-da9f-4be8-8ceb-c6343d12b0e6","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.550685Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:9fdde113c74ba4571febff7388650b298bbcec2e5bdb46c5b5d91f88b4c4ff84","observation_id":"3fd68671-db85-402f-9296-56412498f622","resolution":{"observed_at":"2026-08-07T13:30:35.140662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08325","last_updated":"2020-07-15T22:39:12Z","snapshot_observed_at":"2026-08-09T02:25:07.770800Z","submitted_at":"2020-02-19T17:57:46Z","title":"VQA-LOL: Visual Question Answering under the Lens of Logic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08325","snapshot_observed_at":"2026-08-07T13:30:20.658990Z","title":"VQA-LOL: Visual Question Answering under the Lens of Logic, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.658990Z"},"links":{"cited_paper":"/paper/2002.08325","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:c17c48b110c04848b52e7bc25d097aed2a75c17a089501bab48f3168ebb85c8c","observation_id":"3bcc6fc5-54b4-4187-8022-96eedcfaa940","resolution":{"observed_at":"2026-08-07T13:30:20.658990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.871815Z","title":"paligemma-3b-pt-224.https : / / huggingface","venue":null,"work_id":"3b1ceb21-eaa9-4296-90a8-fb8c3d8358bb","year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.880562Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:ee470985f851314097337856958aab64e80049c8096b74f2b1bd25264ead933d","observation_id":"c8732f46-27d1-4d29-8f49-7bf25efb7c6e","resolution":{"observed_at":"2026-08-07T13:30:34.953633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08253","last_updated":"2021-01-15T16:05:16Z","snapshot_observed_at":"2026-08-09T08:14:24.319659Z","submitted_at":"2020-02-19T16:00:47Z","title":"Distance-Based Regularisation of Deep Networks for Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08253","snapshot_observed_at":"2026-08-07T13:30:20.970889Z","title":"Hospedales, and Massimiliano Pontil","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.970889Z"},"links":{"cited_paper":"/paper/2002.08253","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:da617b0271a692a13f709a65f40ed167862f138ac56ee1017fa4c5a21bc7ff91","observation_id":"be0a20f7-6c23-4b5e-9163-7a69bc48e666","resolution":{"observed_at":"2026-08-07T13:30:20.970889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.640475Z","title":"Finetune like you pretrain: Im- proved finetuning of zero-shot vision models","venue":null,"work_id":"caa34577-c438-42e4-9fa1-3d6c89e3e9a3","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.092328Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:f2b92fbf11de0f759653a66d8dfa56843a823f0b50ee5d75eb3eebad98468d52","observation_id":"faf0a017-4266-436e-8b13-55f39c81540f","resolution":{"observed_at":"2026-08-07T13:30:34.763178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00837","last_updated":"2017-05-15T17:58:49Z","snapshot_observed_at":"2026-07-06T05:21:10.284182Z","submitted_at":"2016-12-02T20:57:07Z","title":"Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00837","snapshot_observed_at":"2026-08-07T13:30:21.172080Z","title":"Making the V in VQA Matter: Ele- vating the Role of Image Understanding in Visual Question Answering, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.172080Z"},"links":{"cited_paper":"/paper/1612.00837","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:8a9ef544f561b0e80efbb76f48af5c987122e3ee724ba45a87d60b0a6a965ea5","observation_id":"f59dcad5-8993-44fe-b3f2-142718843a77","resolution":{"observed_at":"2026-08-07T13:30:21.172080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.449219Z","title":"Rasch, Bern- hard Scholkopf, and Alexander J","venue":null,"work_id":"4ed72d16-aaef-4722-8ac0-704cb99f116b","year":2008},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.290993Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:a21c57e74cc2f8a92936e34049a5b18840545c853437ad4c3a2a8db18af481f8","observation_id":"e87c518b-01a9-425f-9299-bd734b8ffbc4","resolution":{"observed_at":"2026-08-07T13:30:34.536315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.289357Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"84465ef3-03fc-4e9e-99b9-a256803a4579","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.394139Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:abdec5d4f13a345c32c372cfeb3b3e7da3e8d3d92364660dd13df19ca4468edc","observation_id":"c1e5c8ef-62a2-40d5-82f1-ce0e51eaea32","resolution":{"observed_at":"2026-08-07T13:30:34.369265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.027757Z","title":"Natural adversarial examples","venue":null,"work_id":"98c1ed62-497e-46cc-9d4b-ca5c2e79abbb","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.479518Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:820fa94dc71b2a7d0645cc51efa3d76b34470b1648413672ae6494f9fba3865e","observation_id":"2634c300-530b-41dd-a524-07c7847c98ad","resolution":{"observed_at":"2026-08-07T13:30:34.128657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.851070Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"578adc68-e9ed-4c04-b2db-960f3acdbb4f","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.569817Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:fca34967bae8816dd57599d706a2723eaeacdc61a155a4d4ae6093c70b69b1e4","observation_id":"c7664a7c-0b7f-4741-a1a9-3fcfcba3c88f","resolution":{"observed_at":"2026-08-07T13:30:33.937969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.702830Z","title":"Llm-adapters: An adapter family for parameter- efficient fine-tuning of large language models, 2023","venue":null,"work_id":"3c22b1f7-58c8-47f8-b0cc-635e349d4cbe","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.734597Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:7188c4cdaed82f732392588b63a128c12fcbdfd447c296b05a9124a7917fc631","observation_id":"1a0fa88d-cea0-4893-9918-b7a371fa3a56","resolution":{"observed_at":"2026-08-07T13:30:33.789467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.535358Z","title":"Directional gradient pro- jection for robust fine-tuning of foundation models, 2025","venue":null,"work_id":"519c0590-b244-4c24-8f94-f2a7db66ab73","year":2025},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.845558Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:ff9386b3957bf793de2860fcbfaee437f6d46b51d34da33f6cb9038d9d40b638","observation_id":"f819ba40-316b-4a04-af4b-b2d3997b083c","resolution":{"observed_at":"2026-08-07T13:30:33.617956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:22.034752Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.034752Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:89d9919508daae823cfe4cf751db3a3f0b623b2bec083ca444a673dff6be9a4e","observation_id":"5b9d8667-9123-4559-9f65-d7330808bd6e","resolution":{"observed_at":"2026-08-07T13:30:22.034752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.306211Z","title":"Roses are red, violets are blue","venue":null,"work_id":"d2e4d304-f300-4754-ae50-3ad134002b97","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.147432Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:dfb809c54dce6bc339d7a7473fae930e222a37068a4111087293db93d8716097","observation_id":"38927f64-8faf-4754-ba47-630122dc47f3","resolution":{"observed_at":"2026-08-07T13:30:33.411709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.102516Z","title":"Fine-Tuning can Distort Pre- trained Features and Underperform Out-of-Distribution,","venue":null,"work_id":"6e2483fb-fe2b-4446-8cae-75e5c00f5de0","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.264829Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:a1632be0cf4e05715db72df684c94e25ba258c23ee429cf52e9e7144b7796919","observation_id":"38c1c61e-f2ce-4191-878a-a44fc2f8c45c","resolution":{"observed_at":"2026-08-07T13:30:33.216026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.880754Z","title":null,"venue":null,"work_id":"4860dab5-2045-4618-a9ca-e5431162ca9c","year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.408385Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:38ae8376ac6ee0d171c7a1812c23d9f3753e153ff3dd5ace9ebd41d79cb4a718","observation_id":"69669264-d650-4b15-a2e2-dae32b297438","resolution":{"observed_at":"2026-08-07T13:30:32.968130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.642617Z","title":"A Closer Look at the Robustness of Vision-and-Language Pre-trained Models,","venue":null,"work_id":"99c4d470-3c2d-4f7f-84e5-0546ecf70a3b","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.500847Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:82fc067e862ae83e067dd98c7c5eaf822bcad43600932211481e0558764e1303","observation_id":"1fd31f06-8625-42f2-9ae5-51f6f54e6a0d","resolution":{"observed_at":"2026-08-07T13:30:32.743187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00245","last_updated":"2021-08-13T07:01:48Z","snapshot_observed_at":"2026-07-06T11:14:40.299783Z","submitted_at":"2021-06-01T05:54:41Z","title":"Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models","version":2},"cited_work":{"arxiv_id":"2106.00245","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.00245","snapshot_observed_at":"2026-08-07T13:30:28.321459Z","title":"Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models","venue":"cs.CV","work_id":"2662acd5-7142-4359-9d41-c3bfefe1308e","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.701978Z"},"links":{"cited_paper":"/paper/2106.00245","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:43f1efd92d8ff8773a8926833b8918fb618fae6aaeaf75324cefcd324325098f","observation_id":"fb99404b-2d19-48aa-870b-19bb764409bc","resolution":{"observed_at":"2026-08-07T13:30:28.504421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.01483","last_updated":"2018-06-06T08:50:30Z","snapshot_observed_at":"2026-07-06T06:21:49.379500Z","submitted_at":"2018-02-05T15:58:40Z","title":"Explicit Inductive Bias for Transfer Learning with Convolutional Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.01483","snapshot_observed_at":"2026-08-07T13:30:22.787019Z","title":"Ex- plicit Inductive Bias for Transfer Learning with Convolu- tional Networks, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.787019Z"},"links":{"cited_paper":"/paper/1802.01483","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:35e04dc903ea89b4d3183cf1c55cd445e60e6dcfa2f12fdf619c289ef4ac090b","observation_id":"898e22db-0104-4d4b-86ed-89407c199d5c","resolution":{"observed_at":"2026-08-07T13:30:22.787019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08673","last_updated":"2021-03-30T23:51:50Z","snapshot_observed_at":"2026-08-08T01:33:22.286787Z","submitted_at":"2020-12-15T23:41:42Z","title":"A Closer Look at the Robustness of Vision-and-Language Pre-trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.08673","snapshot_observed_at":"2026-08-07T13:30:22.632151Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.632151Z"},"links":{"cited_paper":"/paper/2012.08673","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:86035ae569a4d2492e1477e01bdf43eab5dacacaba9bce6b307242148994f8c6","observation_id":"f660c6de-5279-4c97-8d8e-b59d828749fe","resolution":{"observed_at":"2026-08-07T13:30:22.632151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.234564Z","title":"Robust Visual Ques- tion Answering: Datasets, Methods, and Future Challenges,","venue":null,"work_id":"a93a3346-253e-47cc-b59d-dcdcc28a662c","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.966162Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:7df490782301560040c33850ecb64159244bf1f0bff6470bcfe828daac1dfd26","observation_id":"a1ffed09-94f3-46ab-9c52-9630f9bc08ce","resolution":{"observed_at":"2026-08-07T13:30:32.299018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:23.184037Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.184037Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:dee027cff3390992a1b2392f46ed418d58fad7732d581f4154f2ac088905ab43","observation_id":"4269af3a-bb07-4034-97a6-0a7463af80b3","resolution":{"observed_at":"2026-08-07T13:30:23.184037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.400262Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"695ee067-da11-453e-8ff2-eb01bc7a076a","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.844130Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:dde43d3411b5d8530180f472a21cdc1e092862acc13f0a8c7ca7510c0dd39746","observation_id":"90c00bb2-bd48-4863-b076-1d19ca4046e0","resolution":{"observed_at":"2026-08-07T13:30:32.543685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.739432Z","title":"Maximum mean discrep- ancy for generalization in the presence of distribution and missingness shift, 2022","venue":null,"work_id":"a99f6673-a781-4ab5-9dc8-fd259651a01d","year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.335849Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:12ec54e50dad7271fd34077ef837833558575337b11f8c7c0c8380421d3d98bb","observation_id":"b7231ea7-fe95-46c9-9adb-f7da0ac9cfb9","resolution":{"observed_at":"2026-08-07T13:30:31.868985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:23.427466Z","title":"Moment matching for multi-source domain adaptation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.427466Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:28c4961084a26c5da97e6437f35b37c7e63a3e2e941eaa3a11e80cd5ab642037","observation_id":"0e73b822-b0da-4290-9ba1-a09fb3a64d27","resolution":{"observed_at":"2026-08-07T13:30:23.427466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T13:30:23.504571Z","title":"Learning Transferable Vi- sual Models From Natural Language Supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.504571Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:b146afde9271fdf2b4510fef2b186bfa8a97e9a3afac1e3ffa1e8830072fcd1c","observation_id":"88f7ff7c-038f-4bda-b3a1-b973613dad95","resolution":{"observed_at":"2026-08-07T13:30:23.504571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.004826Z","title":"Generalized out-of-distribution detection and be- yond in vision language model era: A survey, 2024","venue":null,"work_id":"426b1731-abb4-450a-8dea-1d85af289399","year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.272303Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:8f634d33468a0688dff8ec2de7c2185a90def1ca748618ba35f840136669825a","observation_id":"61fbbd8a-08f4-49c3-8cb9-3fdc7df2d140","resolution":{"observed_at":"2026-08-07T13:30:32.111032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.294640Z","title":"Cycle-Consistency for Robust Visual Question Answering,","venue":null,"work_id":"076e3206-8953-43bf-86c2-e4d05540eccf","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.712779Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:4489915f2883f71486ce304d4494bb99d2e2a4e382028213a2c436657b1221e4","observation_id":"d080134e-5c9b-43f2-8bcd-be03d72a3bab","resolution":{"observed_at":"2026-08-07T13:30:31.381355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02280","last_updated":"2021-06-04T06:25:32Z","snapshot_observed_at":"2026-07-06T11:15:52.991403Z","submitted_at":"2021-06-04T06:25:32Z","title":"Human-Adversarial Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.02280","snapshot_observed_at":"2026-08-07T13:30:23.821325Z","title":"Human-Adversarial Visual Question Answer- ing, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.821325Z"},"links":{"cited_paper":"/paper/2106.02280","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:482be82f57416decebfcf7bbe9e780682a393e0774848f248fc2f4b843026539","observation_id":"d0823e45-7a42-42a4-b1a4-ca9660017ca5","resolution":{"observed_at":"2026-08-07T13:30:23.821325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.137961Z","title":"Benchmarking out-of- distribution detection in visual question answering, 2024","venue":null,"work_id":"1854e0af-3edb-4080-b680-fb58de396e0d","year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.931683Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:dd17eb56caea4233a6e57ac4e38cc736a0e9f6f10df2d05c4f7fa0cb81b57986","observation_id":"fd9ff035-e16b-4adf-9f57-3b6b0094dd7f","resolution":{"observed_at":"2026-08-07T13:30:31.214236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.481741Z","title":"Do imagenet classifiers generalize to im- agenet? InInternational Conference on Machine Learning, pages 5389–5400","venue":null,"work_id":"6c69ecac-43d9-423d-b77b-7f105bd042db","year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.652233Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:e7c8011e9297581b406f7316ee934e647f3c926f2b724105d92aaba6c67a940b","observation_id":"2388f9b5-1477-41d1-8439-7a3747386f0b","resolution":{"observed_at":"2026-08-07T13:30:31.584883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-07-06T07:47:04.116217Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-07T13:30:24.067003Z","title":"Towards VQA Models That Can Read, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.067003Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:60a743f0f4cb0297d8b7f27a86e0a9bb4fae397e021f13ae5363f6bb8cb3abd0","observation_id":"8bbb6535-3567-4ef4-aa60-0102cf1f9303","resolution":{"observed_at":"2026-08-07T13:30:24.067003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10720","last_updated":"2023-03-28T15:04:36Z","snapshot_observed_at":"2026-07-06T15:05:27.729596Z","submitted_at":"2023-03-19T17:30:44Z","title":"Trainable Projected Gradient Method for Robust Fine-tuning","version":2},"cited_work":{"arxiv_id":"2303.10720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.10720","snapshot_observed_at":"2026-08-07T13:30:27.300346Z","title":"Trainable Projected Gradient Method for Robust Fine-tuning","venue":"cs.CV","work_id":"ddc29845-6bb5-4141-a850-6ca59d89bb21","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.161750Z"},"links":{"cited_paper":"/paper/2303.10720","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:f4fcd9b9f9e20e42bc915f3b0751af830769b7427cbcf3e290efb8ef60a7c3f3","observation_id":"0e42019f-cbda-4e04-ba92-79ac1ec40df9","resolution":{"observed_at":"2026-08-07T13:30:27.443352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.939866Z","title":"Fast Trainable Projection for Robust Fine-Tuning,","venue":null,"work_id":"58e3e368-3f64-4864-9c3c-3fceaa84adb9","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.217760Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:02fba054c861841a021135bdc86f673b9d696e3e4047934e57cdd217c312eea2","observation_id":"33668d0f-2c8c-4cc1-ac66-6d6060229712","resolution":{"observed_at":"2026-08-07T13:30:30.993713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.768778Z","title":"Rethinking weight decay for robust fine-tuning of foundation models,","venue":null,"work_id":"db0836b6-5b9e-48b8-b5fe-d0a1cf1ad7b4","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.338273Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:fc00b2f21b4343ca97f88cf350f62ed79df602ba77f6a5ee30f5c56d27d2f237","observation_id":"47b5d286-8974-4be9-89b1-1f5097860ca0","resolution":{"observed_at":"2026-08-07T13:30:30.903064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04692","last_updated":"2022-10-10T13:39:08Z","snapshot_observed_at":"2026-07-06T14:03:05.338990Z","submitted_at":"2022-10-10T13:39:08Z","title":"Language Prior Is Not the Only Shortcut: A Benchmark for Shortcut Learning in VQA","version":1},"cited_work":{"arxiv_id":"2210.04692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.04692","snapshot_observed_at":"2026-08-07T13:30:27.863644Z","title":"Language Prior Is Not the Only Shortcut: A Benchmark for Shortcut Learning in VQA","venue":"cs.CV","work_id":"67bb270d-22c2-48d2-9421-70fb39cb9d61","year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.986835Z"},"links":{"cited_paper":"/paper/2210.04692","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:d7652aa7c373117fe4975d3f559568ff104d2a152b1a2af5856a939a0016394e","observation_id":"811af034-14bf-4280-b2cd-fe90acc791f7","resolution":{"observed_at":"2026-08-07T13:30:27.964956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:24.624114Z","title":"Learning robust global representations by penalizing local predictive power.Advances in Neural Information Pro- cessing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.624114Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:5eec76497b87022b7a2da1330118954f04d318af3f00d0b650b84f6ed37185e0","observation_id":"1904a24e-0b23-4a90-b896-316e078bdc05","resolution":{"observed_at":"2026-08-07T13:30:24.624114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.583426Z","title":"Ledsam, Patricia MacWilliams, Pushmeet Kohli, Alan Karthikesalingam, Si- mon Kohl, Taylan Cemgil, S","venue":null,"work_id":"40515725-87ae-4400-82fa-023a672734eb","year":2020},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.721174Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:9e06024b93bdd3a3d80b0e6b565ac3c7de1c5901c244f7c0ccf285ec1d8387f5","observation_id":"384808c0-cd99-425e-bbff-20e5b2a95988","resolution":{"observed_at":"2026-08-07T13:30:30.671410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01903","last_updated":"2022-06-21T21:50:28Z","snapshot_observed_at":"2026-07-06T11:44:19.030296Z","submitted_at":"2021-09-04T17:11:28Z","title":"Robust fine-tuning of zero-shot models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01903","snapshot_observed_at":"2026-08-07T13:30:24.804961Z","title":"Robust fine-tuning of zero-shot models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.804961Z"},"links":{"cited_paper":"/paper/2109.01903","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:bc94890bc09746c4fcf2373c9da419ebd3796b26308bb291a7abb5fc09b06913","observation_id":"4d9224da-b56a-4bd2-9780-c3c15738bbe4","resolution":{"observed_at":"2026-08-07T13:30:24.804961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.449212Z","title":"Domain-robust vqa with di- verse datasets and methods but no target labels, 2021","venue":null,"work_id":"25d23867-46fb-4d2d-a3b5-b59c9bf27dfa","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.935344Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:212feb5e7bb6e21befe505b7c17159fd15b4b24a7bdf6c4cf254f92a753796ef","observation_id":"4c6aae56-da85-417d-b12f-b6f063fb4c4e","resolution":{"observed_at":"2026-08-07T13:30:30.489788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.281164Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":"9809dea4-c92a-4e3f-a415-7fdfe1b90e9e","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.034749Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:a896c3a5498cd1a422db079e5cb04874df233e6639eb1a262f209bd2c5d7df6f","observation_id":"941f0fc7-0f4d-4992-9b64-cae1526f5f1b","resolution":{"observed_at":"2026-08-07T13:30:30.323868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00807","last_updated":"2023-11-01T19:43:56Z","snapshot_observed_at":"2026-07-06T16:41:51.334062Z","submitted_at":"2023-11-01T19:43:56Z","title":"VQA-GEN: A Visual Question Answering Benchmark for Domain Generalization","version":1},"cited_work":{"arxiv_id":"2311.00807","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00807","snapshot_observed_at":"2026-08-07T13:30:26.774745Z","title":"VQA-GEN: A Visual Question Answering Benchmark for Domain Generalization","venue":"cs.CV","work_id":"9f71d36f-4a50-4404-bd90-e51a3fb830f3","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.515854Z"},"links":{"cited_paper":"/paper/2311.00807","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:0b7bb44124159dca9bcb44853c8a4616014ea2d81dc565c21874d2c18e28fcd9","observation_id":"d2431941-ff05-4f0e-b6d8-23218ac4ef36","resolution":{"observed_at":"2026-08-07T13:30:26.964752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.097582Z","title":"We use the LA VIS [29] public repository to fine-tune all methods","venue":null,"work_id":"e9afd2dc-5b7a-4235-bb84-9262c42ce460","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.244751Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:8ef826d15957c9d935c1fc0c701ae770954a263d2e6ae07e018913a398db7d9d","observation_id":"80a62b49-695d-4d90-ba59-05d7e6b9cb98","resolution":{"observed_at":"2026-08-07T13:30:30.195941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.934288Z","title":null,"venue":null,"work_id":"c9dbd067-0c97-4ac3-9625-7b2f229cd820","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.374892Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:5ee0433f8dae78e0424009e7391c5e8771c7607a47fbcb1d2d0ee71364819253","observation_id":"69fa2271-0d8d-48be-93be-d702805d9b76","resolution":{"observed_at":"2026-08-07T13:30:29.997695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.723292Z","title":"7 shows the correlation between shift and performance for different embeddings under different fine-tuning meth- ods","venue":null,"work_id":"8dcf26e5-3681-4db0-aa4c-8ed94dbb740e","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.632830Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:ece54aabbb992ebc43610b399ed6a17d806ee0b1105b12fe3e63c12611df800e","observation_id":"fb31c073-9b8d-4691-bbd2-38ea04c2bb51","resolution":{"observed_at":"2026-08-07T13:30:29.837989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.597525Z","title":"5 shows the heatmap of the correlation between uni- modal and multi-modal shifts per dataset","venue":null,"work_id":"aafa0074-b914-4588-91c5-189f7292045a","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.742953Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:9a38f28721f3c48cda0e15949577c63bfc86667ed037338f10a358e9600ef4d5","observation_id":"be9795bd-9761-486a-a85a-21852dd5a165","resolution":{"observed_at":"2026-08-07T13:30:29.630166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.355396Z","title":"13 and 14 show the variation of MIv and MIq w.r.t","venue":null,"work_id":"549ffc84-f8a3-436f-8a19-a26758667113","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.865612Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:d60084466b79c418ab267695a2352b16b6e3dea3a6ef5e465af79995f8647e58","observation_id":"b7f031ed-deeb-45c6-932c-10e582a2fabb","resolution":{"observed_at":"2026-08-07T13:30:29.448148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.179088Z","title":"8, including LLaV A- 7B [33] with LoRA and PaliGemma-3B with full fine- tuning","venue":null,"work_id":"9688700c-4c5f-4a60-8726-c43ba9dd9fb5","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.995036Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:bbbea658120dbb249bf65ddea11eac142bc25e329973f893a78338ec5c555ef7","observation_id":"84e2c426-a2b8-4bfa-bdec-637609601f3e","resolution":{"observed_at":"2026-08-07T13:30:29.274521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.942478Z","title":"The only exception, GQA-OOD [27] (based on GQA [26]), has only answer shifts","venue":null,"work_id":"545e35c1-a728-43e6-9ea9-790acc568e67","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.134838Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:f4b1e58f53fe4902423ba49230be21695416a34791e970f17f8188ed89a2ab12","observation_id":"1692ec5f-f3e9-49f8-a3bb-aef9de954d75","resolution":{"observed_at":"2026-08-07T13:30:29.064764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.848784Z","title":"We further compare shifts using Maximum Mean Discrepancy (MMD) [12, 20, 37] with RBF kernel in Tab","venue":null,"work_id":"cc1ac5de-4f73-45ef-b14e-d8d8e111b85f","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.255127Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:660488910ce81ad8b751a1eb9ee2fd062c1351f029131858afbb868eb5cb4f99","observation_id":"21b24e27-5652-4d7f-a8f0-b4f6b21c4e7e","resolution":{"observed_at":"2026-08-07T13:30:28.908369Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.777944Z","title":"This also serves as a veri- fication of the reliability in quantifying shifts via feature- based representations","venue":null,"work_id":"c181b2eb-2b1e-4576-b2b1-3c8124384cb7","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.374735Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:2f00d687f3eeec27bf01149301714189009b64d24837571fbb350843a69b2fdb","observation_id":"58e707d3-ed14-4556-88d1-c455496b3fa2","resolution":{"observed_at":"2026-08-07T13:30:28.802066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05660","last_updated":"2019-02-15T02:07:18Z","snapshot_observed_at":"2026-08-04T11:18:15.073564Z","submitted_at":"2019-02-15T02:07:18Z","title":"Cycle-Consistency for Robust Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.05660","snapshot_observed_at":"2026-08-07T13:30:23.772858Z","title":null,"venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.772858Z"},"links":{"cited_paper":"/paper/1902.05660","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:48abb31d816ec6c5ecf5ee64f6c946855531a618a1825d37810603aa333ee9f7","observation_id":"975ea182-8c39-49c2-a8b6-9a6b49c69ca0","resolution":{"observed_at":"2026-08-07T13:30:23.772858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T13:30:21.655216Z","title":"5, 6, 8, 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.655216Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:c4a5185e4c3b685a4ca0236a56140c9629acd0d5fe4b5b273cb9ba1090df301d","observation_id":"79e8ca76-f1a5-4db2-b092-1033396ce1e4","resolution":{"observed_at":"2026-08-07T13:30:21.655216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10054","last_updated":"2022-02-21T09:03:34Z","snapshot_observed_at":"2026-08-09T11:23:03.445810Z","submitted_at":"2022-02-21T09:03:34Z","title":"Fine-Tuning can Distort Pretrained Features and Underperform Out-of-Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10054","snapshot_observed_at":"2026-08-07T13:30:22.333864Z","title":"2, 4, 6, 8, 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.333864Z"},"links":{"cited_paper":"/paper/2202.10054","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:5147894e869027a21381de577ca5ff21cbc16b00cf1b6b722aa5b2b7d803a984","observation_id":"e257422a-c06e-47bf-8cc4-76b650191457","resolution":{"observed_at":"2026-08-07T13:30:22.333864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19182","last_updated":"2023-10-29T22:52:43Z","snapshot_observed_at":"2026-07-06T16:40:12.014275Z","submitted_at":"2023-10-29T22:52:43Z","title":"Fast Trainable Projection for Robust Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19182","snapshot_observed_at":"2026-08-07T13:30:24.269594Z","title":"2, 4, 5, 6, 8, 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.269594Z"},"links":{"cited_paper":"/paper/2310.19182","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:9b977b500702c5607e25f48524562ac01505e701f4d16d0505607c22c3b961a5","observation_id":"d014ed24-983a-45e9-8e21-1acf215453ba","resolution":{"observed_at":"2026-08-07T13:30:24.269594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11471","last_updated":"2024-02-18T08:00:19Z","snapshot_observed_at":"2026-08-06T23:46:22.347744Z","submitted_at":"2023-07-21T10:12:09Z","title":"Robust Visual Question Answering: Datasets, Methods, and Future Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11471","snapshot_observed_at":"2026-08-07T13:30:23.075341Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.075341Z"},"links":{"cited_paper":"/paper/2307.11471","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:7d23f4c5d612111b9d8f25a8f1667680e8352d1ba7703194d840055b037d4918","observation_id":"46c7e70c-9d2e-4cca-9013-9010f64a7775","resolution":{"observed_at":"2026-08-07T13:30:23.075341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T02:25:19.617163Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":5,"verified_fuzzy":37},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2505.21755."}