{"as_of":"2026-08-21T07:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75243a3f7121b276e2c2174c4da74a6d49fc7698b3523eb390898561d51e09ea","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:50:19.424861Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07861/citation-record","integrity":"/paper/2608.07861/integrity","json":"/paper/2608.07861/citation-record.json","paper":"/paper/2608.07861"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.017635Z","title":"VQA: Visual Question Answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.017635Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0061fceb1d4754809ac6abe97cf39a9ab80fa889a0b80dd96b6720453052f97c","observation_id":"71d47ad8-bae6-495f-9981-555a93e09997","resolution":{"observed_at":"2026-08-12T00:50:19.017635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.022230Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.022230Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:7aa2c904818acc051428fcf53732077d53355cdf2fd869ca03557a785e83f7eb","observation_id":"8d7bdee0-3f56-4293-b5f7-efcfc3389f5c","resolution":{"observed_at":"2026-08-12T00:50:19.022230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-08-13T14:52:21.014234Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-12T00:50:19.026832Z","title":"Project Aria: A new tool for egocentric multi-modal AI research,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.026832Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:1bfb350e933269951e14597c7830f58b959e31c5b7340c2f4ba53d0e3a2ac353","observation_id":"aeee4825-6bf1-400e-b230-b03f9f69aee0","resolution":{"observed_at":"2026-08-12T00:50:19.026832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.031728Z","title":"Ray-Ban Meta AI glasses gen 2 & gen 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.031728Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0b14e2d72a985662baaa522014f701be44cd9f05a0b1f76bfc3cfc5900ae28db","observation_id":"51d95b2f-c7d9-4ea4-819e-9c7989f2f0c0","resolution":{"observed_at":"2026-08-12T00:50:19.031728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.036101Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.036101Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:935e23da71266c0747dbda169c4f13a6f6ea415e64252974f3e4e10df820345a","observation_id":"ca9a5527-1242-4b86-bd1c-85c3fadb4b4f","resolution":{"observed_at":"2026-08-12T00:50:19.036101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.040708Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.040708Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:e782e37086e779a7d83348f3649354cbcffd2e067f6e6fe43ad0f1971306deb3","observation_id":"c423ef81-b965-4ded-9423-26bd29476cc2","resolution":{"observed_at":"2026-08-12T00:50:19.040708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.045319Z","title":"VizWiz grand challenge: Answering visual questions from blind people,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.045319Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:6cf8a0f50f03ee0722ff912a7ab525f5a0ca9e2ea9e350b21238067851a9e7c0","observation_id":"5f6c1989-ff9c-411f-9b78-d5a98caf6067","resolution":{"observed_at":"2026-08-12T00:50:19.045319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.049342Z","title":"Be My Eyes: Lend your eyes to the blind","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.049342Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:3f94d5a8eb4eff9b6d25b7ad07480eab84f4aa4507641218a041b4d484a7b763","observation_id":"2ec2a70d-2d04-40e7-9f53-bd449a390a50","resolution":{"observed_at":"2026-08-12T00:50:19.049342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.053382Z","title":"Long-form answers to visual questions from blind and low vision people,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.053382Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:15b9955d857d2294e321ec11631c630158117587171722a888a95a9e613c3bdd","observation_id":"c7a0d083-22a2-4034-b581-b6528d7cdf17","resolution":{"observed_at":"2026-08-12T00:50:19.053382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.057368Z","title":"Augmented reality anatomy visualization for surgery assistance with HoloLens,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.057368Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:e35246d8774a76b25d1f023a18b6bf3a1c90df5ce8fbeb053ff9ef573fdd2849","observation_id":"f809fab8-781e-4a98-a07b-14dbb91febbb","resolution":{"observed_at":"2026-08-12T00:50:19.057368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16597","last_updated":"2024-12-24T08:14:36Z","snapshot_observed_at":"2026-08-21T01:26:22.314548Z","submitted_at":"2024-12-21T12:03:31Z","title":"LLMs Enable Context-Aware Augmented Reality in Surgical Navigation","version":2},"cited_work":{"arxiv_id":"2412.16597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16597","snapshot_observed_at":"2026-08-12T00:50:19.842494Z","title":"LLMs Enable Context-Aware Augmented Reality in Surgical Navigation","venue":"cs.HC","work_id":"0916825e-4512-4297-97ed-2c338275fc0e","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.061282Z"},"links":{"cited_paper":"/paper/2412.16597","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:2e692e2f223984fefb7af09a16c9224f53a562c632a3df572b96a9d8afd60f7f","observation_id":"f4e53888-1f74-4bcb-8700-525f7fbc0d40","resolution":{"observed_at":"2026-08-12T00:50:19.847198Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.065974Z","title":"DriVQA: A gaze- based dataset for visual question answering in driving scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.065974Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:de7144ccfcfdec8bc8e459d1a8f154bfbbd31e51ce424b85d275797b7dec6c87","observation_id":"1f4ba1a6-b0cd-47fd-affe-6011636153dd","resolution":{"observed_at":"2026-08-12T00:50:19.065974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.069805Z","title":"Mimicking human attention in driving scenarios for enhanced visual question answering: Insights from eye-tracking and the human attention filter,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.069805Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:e93700e786f8c18d714dabfb267ec22937e3b03f965f8605da6de48f2ede14ec","observation_id":"f23872a6-04d1-484e-93c5-fa11a7b911cf","resolution":{"observed_at":"2026-08-12T00:50:19.069805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.073724Z","title":"Demystifying small language models for edge deployment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.073724Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:5d6c38db9c21b071fc68a2d58688efe81397108e047552e28e0c2e9ea6a38d07","observation_id":"0e174cce-37bf-44c7-a1d0-9ecab01484fb","resolution":{"observed_at":"2026-08-12T00:50:19.073724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.077650Z","title":"Efficient processing of deep neural networks: A tutorial and survey,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.077650Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:248cddfa442be239caeda2fa5daa2c2b7ad9418e321ac680acee4f9e5fd5e764","observation_id":"4f3be074-5d14-4261-9b0f-284edc6d3958","resolution":{"observed_at":"2026-08-12T00:50:19.077650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.082137Z","title":"LLM in a flash: Efficient large language model inference with limited memory,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.082137Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:c7cb7149ce3f4d9c9bfcf3adb2440262c086a1c6ec3af03c25cd987c8daf74fc","observation_id":"3f716f81-e7ef-4153-bce3-1a2d210cacd2","resolution":{"observed_at":"2026-08-12T00:50:19.082137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.086239Z","title":"Mo- bileLLM: Optimizing sub-billion parameter language models for on- device use cases,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.086239Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b1d0fbd5ff4cef34ac2cc721efac5b3a09ec058ce3a9920c3056a8c51c50d369","observation_id":"093f752c-10f3-48fc-aea0-9e19b5827545","resolution":{"observed_at":"2026-08-12T00:50:19.086239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-12T00:50:19.090469Z","title":"MobileVLM: A fast, strong and open vision language assistant for mobile devices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.090469Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:1ae1a0231af7c712a392fb9a683f911c4697427d308c0752ac4f4fa4d9bbde0e","observation_id":"ed140e8c-6bb7-4a98-bae5-f052bb71ac1e","resolution":{"observed_at":"2026-08-12T00:50:19.090469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.095087Z","title":"Bench- marking tinyml systems: Challenges and direction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.095087Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:efc3aa5d8932d98718466954a7c6067ae867e2d43f2fbfaaf93522ef29b06428","observation_id":"5591e1b1-915d-433f-9465-befe03319a4a","resolution":{"observed_at":"2026-08-12T00:50:19.095087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-19T20:26:10.685439Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-12T00:50:19.099492Z","title":"Tinyllava: A framework of small-scale large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.099492Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:c87496fb3bf2a0fbb2ab892bf24c5d3f9e7f4cd3cb0a0fc8ba34001eeb1eb023","observation_id":"e0624723-5114-4f44-ba70-eaa0a743094d","resolution":{"observed_at":"2026-08-12T00:50:19.099492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.103858Z","title":"Rokid AI & AR glasses—redefining reality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.103858Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:3484c307464cf47c2fad2a37af397afa75177a70a0cd2e671750435fe4338832","observation_id":"030b6d04-1204-49be-9816-dcd0f2bb3b2d","resolution":{"observed_at":"2026-08-12T00:50:19.103858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.108144Z","title":"Project Astra: A research prototype exploring the future of AI assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.108144Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:5bf5f1c3ff954d8f8790d4e880cf3ebdd6e2a810e5aa4a00abd5599ece4cb3bf","observation_id":"33c982d4-3c83-47e6-acb7-fa530e2c4d11","resolution":{"observed_at":"2026-08-12T00:50:19.108144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.714680Z","title":"Google vs meta smart glasses: Which AI frames are better","venue":null,"work_id":"c1cc2de2-472a-4297-9cd7-f106c01d36f3","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.111993Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:44a98632ce7fba127263f2bf4a0737ea1fdc5f12bb74a2efd464fe693fe1c32c","observation_id":"43286f77-d8ae-43c3-9bf8-3483d41a9953","resolution":{"observed_at":"2026-08-12T00:50:20.719204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.700698Z","title":"Edge cloud offloading algorithms: Issues, methods, and perspectives,","venue":null,"work_id":"99dbf69f-f95d-471a-aa39-aa220680c921","year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.115924Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:388aa574ebe7edd65bc8d519558fc7d01683720b4ba2c102f9341fcef9018959","observation_id":"f4719216-9ab0-4982-9300-c7e5fadb17c7","resolution":{"observed_at":"2026-08-12T00:50:20.705801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.684355Z","title":"Cosmos:computation offloading as a service for mobile devices,","venue":null,"work_id":"4581fb92-9256-4137-8117-c013d1938c53","year":2014},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.119812Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:5027308a54f5d0f971b579985f7fad836e5e13566b807ab0d9ba5513bf28466e","observation_id":"e2197941-1bf2-423d-afa5-c6c52a9dda66","resolution":{"observed_at":"2026-08-12T00:50:20.690590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.670600Z","title":"To offload or not to offload? the bandwidth and energy costs of mobile cloud comput- ing,","venue":null,"work_id":"db038cba-de0a-42b1-a2c9-20795134db7d","year":2013},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.123655Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b7cec591147d510157828a32eb15249a95481e6636c832e80dbde28f8a22731d","observation_id":"b49ec1be-5003-4b1d-8980-a2abd19fa10c","resolution":{"observed_at":"2026-08-12T00:50:20.675452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.658806Z","title":"Images and vision,","venue":null,"work_id":"bf9fbe64-3382-4f8e-bf11-4f3d75b731b3","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.127468Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:71fa9e828631f409fc93ca2dd9711b8d02f506d69d0cc9c6996373546e0db817","observation_id":"46a2ff98-5f5e-4710-8ec2-ac5fa2d36e6f","resolution":{"observed_at":"2026-08-12T00:50:20.662673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.644584Z","title":"Understand and count tokens — gemini api,","venue":null,"work_id":"a03ebde6-141a-424a-8c84-5a21536d1dfc","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.131426Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:3cd982054004b4215fd622f22de194849e3ff61e50ccd904c1439bfdb6b50470","observation_id":"e1199267-7777-484a-be17-82f4ba020a32","resolution":{"observed_at":"2026-08-12T00:50:20.650544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.632459Z","title":"A-vit: Adaptive tokens for efficient vision transformer,","venue":null,"work_id":"8905d36c-1788-4d09-9c9d-8bbac45e41ee","year":2022},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.135656Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:706a9b1af99bd9964f090796031383be68784fb0629c317f196de771ff3f404e","observation_id":"e2f21d7e-8e38-48c8-a39c-c1f0178b018b","resolution":{"observed_at":"2026-08-12T00:50:20.636667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.139426Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.139426Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:1e2aad577d9117c52b0e0fccde6079e33370d41f14a61fc7204a23d348b18c98","observation_id":"6d2e4ea8-265e-463d-9465-ec7bf0e3941a","resolution":{"observed_at":"2026-08-12T00:50:19.139426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.610781Z","title":"Token merging: Your vit but faster,","venue":null,"work_id":"e2a0c944-eea8-4db8-8de0-b6a6b65481e2","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.143097Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:d28034433fe4b5d4ec98f177da467fb5d780350e26c32d3671421e915e48edfb","observation_id":"b1f216e8-d0ab-496d-9366-3b51981bba7a","resolution":{"observed_at":"2026-08-12T00:50:20.615091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.597593Z","title":"Elf: Accelerate high-resolution mobile deep vision with content-aware parallel offloading,","venue":null,"work_id":"cfb51693-95d3-4ed7-b86f-bc50ef6b9538","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.146721Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:160bde3c3fd9510d13d71ae890110c5319b6d78b4d3cc8ee6e759aa26f6b4149","observation_id":"6fb6ed1d-b647-4032-bb55-085660552667","resolution":{"observed_at":"2026-08-12T00:50:20.601893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.584126Z","title":"Accumo: Accuracy- centric multitask offloading in edge-assisted mobile augmented reality,","venue":null,"work_id":"7cfd93bb-e01a-40f7-b76d-f64ff9d53551","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.150710Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:be195aa57c09d9e0c7225a22f1d2347126949a3bf900886c2ae0f64a48c26e43","observation_id":"c815e248-ed3e-4b28-ba44-419e630d7ae0","resolution":{"observed_at":"2026-08-12T00:50:20.589138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.571008Z","title":"Deep contextualized compressive offloading for images,","venue":null,"work_id":"e0eccb51-4092-4563-ad1f-b316d0db3e04","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.154686Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:41b8eea68a6e50b1f5f19695a2a61898ff7425d4eca4726f21fb4467be69ebc4","observation_id":"db119f59-071d-4edf-b611-a1ad706dad96","resolution":{"observed_at":"2026-08-12T00:50:20.575387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.557255Z","title":"Towards wearable cognitive assistance,","venue":null,"work_id":"e9c8ef5f-5589-4470-be2e-93596d7cf195","year":2014},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.158591Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:96ac6dd1fea725758b5aa181b9889afdf7355e50a3f735cf26856f6148eae6da","observation_id":"62d30240-4617-49fe-8b99-a546eb9e352a","resolution":{"observed_at":"2026-08-12T00:50:20.561858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.162754Z","title":"Deep learning with edge computing: A review,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.162754Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:3b62e782234d450f7077baf3eb0e9cde02ed466d620e3ab5357d82cf18b1a301","observation_id":"e1736367-04fd-4dca-81ad-2fa144d30a94","resolution":{"observed_at":"2026-08-12T00:50:19.162754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.534946Z","title":"Color-to-grayscale: Does the method matter in image recognition?,","venue":null,"work_id":"01f4e353-1af6-4f2b-b68c-5ca15bb44953","year":2012},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.167041Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b3dbc5852305ad4c66aa24741d96ca365b81803b8c87762d8f46155ea934508b","observation_id":"b611c525-e955-40b7-9ec3-84c34dd7569d","resolution":{"observed_at":"2026-08-12T00:50:20.540375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.170915Z","title":"The jpeg still picture compression standard,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.170915Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:9e1462fe1465ac594b19a0d9366e8b4b6e4468cae178dfbd5a63213a2ba656fa","observation_id":"82072b31-de42-4ac8-bb17-d7543c2d9d70","resolution":{"observed_at":"2026-08-12T00:50:19.170915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.516349Z","title":"Learning to resize images for computer vision tasks,","venue":null,"work_id":"400f8545-bd34-48ec-b343-c5f5eddcfb55","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.174922Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:2ec8c172e448662efb7b8adad1a0de83d7dd4cce5a79f5628b65d308d3896583","observation_id":"a4b2b770-2d6d-4fd1-af7e-2750e9d6511e","resolution":{"observed_at":"2026-08-12T00:50:20.520409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.504899Z","title":"VQA-MHUG: A gaze dataset to study multimodal neural attention in visual question answering,","venue":null,"work_id":"58681d77-1532-49d4-8b8f-4657f56b358b","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.178967Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a6297291bb3be64594860c0f1521eb42a12bab76251f35eb2e4c742fff9f3049","observation_id":"6e7aa746-6bc4-4004-a37f-d48474ab831a","resolution":{"observed_at":"2026-08-12T00:50:20.509216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.492697Z","title":"Eye gaze tells you where to compute: Gaze-driven efficient vlms,","venue":null,"work_id":"d0c1b6e2-f366-42a8-9e31-5d393a6920b5","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.182640Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:8e3876d8fbaf26633d68e6c92815567651ae413c74fa79b6b86993e38227e7a9","observation_id":"8c632c78-07be-4139-a733-c27e553b0ce6","resolution":{"observed_at":"2026-08-12T00:50:20.497438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.480591Z","title":"Saliency detection: A spectral residual approach,","venue":null,"work_id":"1403715e-fe58-44eb-9949-502933e75f10","year":2007},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.186564Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:7274ede6a0a602e66d59d6691d866fd182d3fe21f84caa156b13cbcfcd6c231b","observation_id":"ea0c5c9b-871a-45d3-924c-b67571e48b83","resolution":{"observed_at":"2026-08-12T00:50:20.485099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.468905Z","title":"Saliency driven perceptual image compression,","venue":null,"work_id":"320cfcd4-1955-4919-a468-114958a9a03e","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.190484Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:6d82960edf76f01d4e98ea2fdfacfff3f074cf6b32d35e12773ecde11183cc66","observation_id":"2984d488-75ea-4a56-b6c8-3cfd71b74027","resolution":{"observed_at":"2026-08-12T00:50:20.473103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.457507Z","title":"Visual cropping improves zero-shot question answering of multimodal large language models,","venue":null,"work_id":"b82363c5-6cb4-4264-bf82-ec90b547d2fa","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.195307Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b35b8e7f88b46da36443148a78d311f97bd6c8aa6a4c84e616d19b1026ae9eec","observation_id":"46657777-0be2-4c24-a490-16df0595a874","resolution":{"observed_at":"2026-08-12T00:50:20.461376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.445887Z","title":"Edge assisted real-time object detection for mobile augmented reality,","venue":null,"work_id":"fc14fcd5-dd2d-4137-96a8-ca4c41855aff","year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.199136Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:be1fac3e8f1d5bb70dcdfa7dfea157146d3907ec3c57b11f50983a7d272e0aaa","observation_id":"0661ec84-8aed-4a0c-9051-4f3a6796db86","resolution":{"observed_at":"2026-08-12T00:50:20.450028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.434143Z","title":"Glimpse: Continuous, real-time object recognition on mobile devices,","venue":null,"work_id":"3e88be33-dd95-4ea1-bbbb-ba6a24932627","year":2015},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.202934Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0f34a493c4e375a3ebb25993212bdef4f6b8834f9db059e9d6ef1afb32d44a3e","observation_id":"6d1ff298-076a-42f4-9024-d3724fdc2cd0","resolution":{"observed_at":"2026-08-12T00:50:20.438645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.422089Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answering,","venue":null,"work_id":"2490808e-1f96-44c7-98a3-76312ffc3c52","year":2017},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.207129Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:64b98343e46cf35637b19a52b59b062aeb9c6f5cd883b3fed7f19cdda0fa0193","observation_id":"bb99a795-38e0-4c1d-834e-d84387269ab0","resolution":{"observed_at":"2026-08-12T00:50:20.426348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.409933Z","title":"MMBench: Is your multi- modal model an all-around player?,","venue":null,"work_id":"3bea926c-e0f0-48ca-939d-3fcdc4b2fd91","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.211247Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0f4cda717b4a5ac78ce01d476665a34a7dbba9d74d85addf92c79e4d663beacb","observation_id":"a4b4c0c5-25ef-4e90-8c8c-a85746a2e407","resolution":{"observed_at":"2026-08-12T00:50:20.414074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.397135Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI,","venue":null,"work_id":"d91f4ea8-8742-4dde-88a6-d6066daed4ce","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.215889Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a15217f38d2817ae4c91744a114666ec858b51dd617d14b7e749dda2d6ae6a95","observation_id":"af7e46f8-ecda-49b8-af04-3f441fd59c3e","resolution":{"observed_at":"2026-08-12T00:50:20.401510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.384652Z","title":"MathVista: Evaluating mathematical reasoning of foundation models in visual contexts,","venue":null,"work_id":"45ac3593-57e6-401e-868a-4f32bdf5eab9","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.219803Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:102dd269e8064aeb361c87d75d0bab478f47f6a176c71613622d6f2359d10cab","observation_id":"2659ab9f-0bc5-4bfb-bbd5-c13dde02c5d8","resolution":{"observed_at":"2026-08-12T00:50:20.389142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.372219Z","title":"HoloAssist: An egocentric human interaction dataset for interactive AI assistants in the real world,","venue":null,"work_id":"e6bc48dc-404c-4bfe-952c-0aadb6099284","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.223759Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b0b254f1e0f7172d86c9259ba95e795364ed5c7e0363db5835b782c73533a536","observation_id":"fab0333c-8dcf-4f0b-a835-2e2417777199","resolution":{"observed_at":"2026-08-12T00:50:20.376588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.359510Z","title":"WearVQA: A visual question answering benchmark for wearables in egocentric authentic real-world scenarios,","venue":null,"work_id":"add6423f-6293-40e8-9bb5-fbc7155111e7","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.228109Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:2ddbbe15927a839df82b2bf64380ccfb71c17ee20ac15816c5936303f35b26a9","observation_id":"92215827-6b85-4a43-9454-1c9eaaba8522","resolution":{"observed_at":"2026-08-12T00:50:20.364074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22683","last_updated":"2026-04-09T08:16:21Z","snapshot_observed_at":"2026-08-11T13:27:58.809108Z","submitted_at":"2026-02-26T06:55:48Z","title":"SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22683","snapshot_observed_at":"2026-08-12T00:50:19.232005Z","title":"SuperGlasses: Benchmarking vision language models as intelligent agents for AI smart glasses,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.232005Z"},"links":{"cited_paper":"/paper/2602.22683","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:cf6a3f0ec2c09650b372b63dc3f361ecff3295ff8871fc618bd975688366731d","observation_id":"ea3fede4-c24d-4cf7-a57f-7641895da963","resolution":{"observed_at":"2026-08-12T00:50:19.232005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.238653Z","title":"CRAG-MM: Multi-modal multi-turn comprehen- sive RAG benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.238653Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:d1dcacb1ae4c40f91d700bec35d261c000367a103d9d624216a395aa1c202600","observation_id":"9510abb9-44a5-4dd3-aab4-f6334dcd9568","resolution":{"observed_at":"2026-08-12T00:50:19.238653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.347516Z","title":"OK-VQA: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":"f618e5bc-1f69-4fc9-b009-e0dd17930218","year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.242494Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:17a7a62df7c795b23b517c39b2c4cc6d1818023613277f18de7f4a2072cac6c9","observation_id":"d117e68e-2597-4511-8a8f-cd4b438c1b90","resolution":{"observed_at":"2026-08-12T00:50:20.351783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.335550Z","title":"MISAR: A multimodal instructional system with augmented reality,","venue":null,"work_id":"7d000b8a-ab4b-410e-aa6c-4b6210c391d4","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.246484Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a71b6227b8e9bc9c826660cbacb0c239eb34c0150ef2e279f5ffc0599d67e793","observation_id":"a41e1861-e52a-4ab1-ba2f-2da8df2db08a","resolution":{"observed_at":"2026-08-12T00:50:20.339738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.324274Z","title":"Guided Reality: Generating visually-enriched AR task guidance with LLMs and vision models,","venue":null,"work_id":"b32361a7-13ae-4472-8b2f-3ca8ced63a94","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.250850Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:4621fdafd7879bfbb32500a3a884f6433df79273a1b7076981552b89622c9762","observation_id":"e10d0e33-8929-4845-b0c5-9b401e07c111","resolution":{"observed_at":"2026-08-12T00:50:20.328278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08158","last_updated":"2025-03-11T21:54:08Z","snapshot_observed_at":"2026-08-16T13:26:15.067528Z","submitted_at":"2024-08-15T13:48:44Z","title":"EmBARDiment: an Embodied AI Agent for Productivity in XR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08158","snapshot_observed_at":"2026-08-12T00:50:19.254659Z","title":"EmBARDiment: An embodied AI agent for productivity in XR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.254659Z"},"links":{"cited_paper":"/paper/2408.08158","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:7124b4b0df59d5247b3cebf33f492535ce7d862b49e643da9ad6cc6ee90ef401","observation_id":"54592885-ffbf-410c-9493-1fea13cc1cd7","resolution":{"observed_at":"2026-08-12T00:50:19.254659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.311716Z","title":"GazePointAR: A context-aware multimodal voice assistant for pronoun disambiguation in wearable augmented reality,","venue":null,"work_id":"f4872e1a-ab0c-4745-9903-2262da31da69","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.261066Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:e3a652d7c5467fbbd6330947cca560c7914ce7f7771d52af93b5807cb0b24f27","observation_id":"ef168b0b-05ee-4c8c-acfc-835114242bdf","resolution":{"observed_at":"2026-08-12T00:50:20.315950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08774","last_updated":"2025-08-12T09:20:20Z","snapshot_observed_at":"2026-08-20T19:02:47.968219Z","submitted_at":"2025-08-12T09:20:20Z","title":"Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance","version":1},"cited_work":{"arxiv_id":"2508.08774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.08774","snapshot_observed_at":"2026-08-12T00:50:19.694288Z","title":"Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance","venue":"cs.AI","work_id":"81ef696d-ef4b-44d1-8720-4820aa4ae975","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.265562Z"},"links":{"cited_paper":"/paper/2508.08774","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:41df3bc434712eceb30e94edac805854fb1bf98b781b75fb2ad4a58a5e235fa9","observation_id":"743d7ba5-8ffe-416b-9a38-98f7ed88fb16","resolution":{"observed_at":"2026-08-12T00:50:19.701778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15604","last_updated":"2025-02-21T17:19:39Z","snapshot_observed_at":"2026-08-16T12:56:17.580937Z","submitted_at":"2025-02-21T17:19:39Z","title":"Cross-Format Retrieval-Augmented Generation in XR with LLMs for Context-Aware Maintenance Assistance","version":1},"cited_work":{"arxiv_id":"2502.15604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15604","snapshot_observed_at":"2026-08-12T00:50:19.671938Z","title":"Cross-Format Retrieval-Augmented Generation in XR with LLMs for Context-Aware Maintenance Assistance","venue":"cs.IR","work_id":"5c95cdf2-b484-4ac9-ae72-4b83ad88f369","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.270631Z"},"links":{"cited_paper":"/paper/2502.15604","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:da8f1d47fd541d30c7879d64b363e57e3dab4c9d19d30f62ecf8f0e12e7cb11f","observation_id":"01dd9cdc-092c-4bb0-bc95-48c813e8338f","resolution":{"observed_at":"2026-08-12T00:50:19.676748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15624","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.649111Z","title":"Exploring the use of VLMs for navigation assistance for people with blindness and low vision,","venue":null,"work_id":"51ae223a-af55-44fc-91ff-dc8c704c6e8f","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.275112Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:49e2a9e3942a07e8526dd0261a32d5739be8b1a94b038ea18bbb74101ed1ef46","observation_id":"6676f53c-2d73-4ea9-8c37-0990526deebc","resolution":{"observed_at":"2026-08-12T00:50:19.657100Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06010","last_updated":"2025-09-07T10:58:17Z","snapshot_observed_at":"2026-08-15T21:58:29.706187Z","submitted_at":"2025-09-07T10:58:17Z","title":"BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users","version":1},"cited_work":{"arxiv_id":"2509.06010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06010","snapshot_observed_at":"2026-08-12T00:50:19.564824Z","title":"BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users","venue":"cs.CV","work_id":"ae23c111-a4f0-4ad8-9a13-05c0186db608","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.280108Z"},"links":{"cited_paper":"/paper/2509.06010","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:2df589563e1e313daa1497bf89683c92ae38818b008a91891278d6b690bf6acc","observation_id":"ed1391d9-df16-421e-b77a-79a1b2965b96","resolution":{"observed_at":"2026-08-12T00:50:19.569534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.300112Z","title":"Objective assessment of the webp image coding algorithm,","venue":null,"work_id":"5ca601c6-c02f-4c71-ba3c-16228e640b05","year":2012},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.284581Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:4552d70f106601cde2fc22f7bf6e9ce3e87fa076b9c2d8d8e6e9f33cda7dac1c","observation_id":"22753e43-642f-43cd-833a-286ca03f7fa5","resolution":{"observed_at":"2026-08-12T00:50:20.304358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.288910Z","title":"Vision - claude api docs,","venue":null,"work_id":"9c655e24-e2bb-4378-95d1-577e828477a6","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.288751Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a3ada34b6f68d5de34cfeb956217da14166bdba5531aa18220932843397c871c","observation_id":"01bace46-f84d-4361-85c5-794780a21227","resolution":{"observed_at":"2026-08-12T00:50:20.292984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.276734Z","title":"Image understanding — gemini api,","venue":null,"work_id":"bb2e02be-be84-4b2c-92aa-283b6be7bd0b","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.292821Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:fec5fdacb4edc99d1bc4fb3263096319b4c1be25e2905b3622311b8fdf075aa5","observation_id":"fa6fb7df-483a-4d21-956c-805c2a386197","resolution":{"observed_at":"2026-08-12T00:50:20.281030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.264128Z","title":"Image interpolation and resam- pling,","venue":null,"work_id":"56386a04-d452-4f0f-85d0-4ac2f52a5450","year":2000},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.297025Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:202c4b146aae3f293d2391294845e951f2109113b3cb67b51811e01e12c66ed0","observation_id":"41af0a65-9a0f-4dd8-8072-cab64b6cb2a6","resolution":{"observed_at":"2026-08-12T00:50:20.268208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.251052Z","title":"Colorbench: Can vlms see and understand the colorful world? a comprehensive benchmark for color perception, reasoning, and robustness,","venue":null,"work_id":"f0b6492c-6794-4f2e-8d0c-dc350cc2d342","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.301374Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:78796d49e052a832d95d7b94de215a7b2d23b0a8286d09ab0e776e10f2012f6b","observation_id":"f99b59f9-f810-4d14-8e34-e9a36a3fd0cd","resolution":{"observed_at":"2026-08-12T00:50:20.256188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.237453Z","title":"V oila-a: Aligning vision-language models with user's gaze attention,","venue":null,"work_id":"bcd3d103-6240-47dd-87c7-a97fbf4a95fb","year":1918},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.306560Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:9cc14fb717fdd4d5f9b581dc1210803728f031d5f798fb06f718e5f4cd982f85","observation_id":"6c8b19a3-96f7-42bb-86d6-9061eba41935","resolution":{"observed_at":"2026-08-12T00:50:20.242817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.223726Z","title":"EgoVQA—an egocentric video question answering benchmark dataset,","venue":null,"work_id":"23eb9e09-acab-4892-97ba-742300e9f6a5","year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.310732Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:e6e10d0cff32ae28b18cdbe3886c3a3fd8d1dedf86e897f1398fdfd5979ae180","observation_id":"f87e2bc5-b3fd-4be5-8c95-6ba2989c591d","resolution":{"observed_at":"2026-08-12T00:50:20.228121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.212040Z","title":"Neural machine translation of rare words with subword units,","venue":null,"work_id":"cc12ddc3-9b6f-4ada-a463-00bcfefd4055","year":2016},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.314944Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:6d1dbbf22dc46ba308de0df2aa23a73a00d4eb80ee83754aedbdba59d03801cf","observation_id":"9bf1c15d-5ff4-405f-8e17-d64dfc0701e2","resolution":{"observed_at":"2026-08-12T00:50:20.216201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.200518Z","title":"What are tokens and how to count them?","venue":null,"work_id":"e3cdff72-7fd8-4a8d-aba2-ed988775de96","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.319134Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:d43bb7269c3e9b85539da600367131175afaa00c3250bda2f1d59220d00045da","observation_id":"2fd64ec6-85d1-4967-b5d8-38c431fa085d","resolution":{"observed_at":"2026-08-12T00:50:20.204919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.188285Z","title":"Saliency based image crop- ping,","venue":null,"work_id":"6d9f7e98-6cf9-4eed-bef2-c4aa5caee9b2","year":2013},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.323268Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:3363d24ab4bdb446d6614cc37e6e771e5ed432a72efe7b4dc66690313f3c855e","observation_id":"5da132dd-8582-4cbc-8c93-f29ca696bc7f","resolution":{"observed_at":"2026-08-12T00:50:20.192706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.174841Z","title":"Benchmarking deep learning models for object detection on edge computing devices,","venue":null,"work_id":"44fa5605-bd00-4d50-915c-7c41eeacd0cc","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.327140Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:dc34d37ba69cff897e46473ba16ed3644ee7909ee6a4c6e33ece760f157c36a9","observation_id":"2794bdd8-29c7-47b4-a08d-47226a09f943","resolution":{"observed_at":"2026-08-12T00:50:20.179180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.162326Z","title":"Region-of-interest extraction method to increase object-detection performance in remote monitoring system,","venue":null,"work_id":"37915ada-c54a-4c5c-98f6-768ff6d58bd1","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.330909Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:70996d2cbf5d2fcf5e678f0dba7db2550affb30d3358eed15874d7e5f759e8b4","observation_id":"89aca3b1-210a-4f3c-a678-ffd30360e0e6","resolution":{"observed_at":"2026-08-12T00:50:20.166519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.149986Z","title":"Improving automatic VQA evaluation using large language models,","venue":null,"work_id":"f7e0b93b-732f-4ca5-8033-2ba2db238b47","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.335462Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a5bb1e18015480a7f86d36545d164957bd4fa0f85861011f5c6271b493c682da","observation_id":"d50df610-97c5-461a-ad07-33e8fbcfb191","resolution":{"observed_at":"2026-08-12T00:50:20.154479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.137674Z","title":"Mind the uncertainty in human disagreement: Evaluating discrepancies between model predictions and human responses in vqa,","venue":null,"work_id":"af311bf5-b19b-46de-8e2f-2c65f821f42a","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.339617Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:8aa64e829fa5b6e830cc4d34eb4381954367fa32c3c01caef3d0b1ef60308aee","observation_id":"33234788-e51a-4184-b466-9825241e5b41","resolution":{"observed_at":"2026-08-12T00:50:20.142051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.122568Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena,","venue":null,"work_id":"9c4ff41e-ec8c-4c08-bccc-00beabe63dfa","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.344182Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:ba632902de32ab4180a2f45e9e2e20d223670922ca5d8316c1b8a9d6e6aa3e07","observation_id":"0f4ff4da-137d-44ba-8cf0-faab0953198f","resolution":{"observed_at":"2026-08-12T00:50:20.128003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.107710Z","title":"G-Eval: NLG evaluation using GPT-4 with better human alignment,","venue":null,"work_id":"f05628de-ca38-4cf1-9a57-aefac5b8cf91","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.348271Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:4501e821e7684f9cce608fb9c4224ebf12198029c7b1236db8d1e781963df7e5","observation_id":"afd1f3e0-03c3-4560-98cf-b74131d5675a","resolution":{"observed_at":"2026-08-12T00:50:20.113194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.094930Z","title":"Chatar: Conversation support using large language model and augmented reality,","venue":null,"work_id":"84e1dbd4-24d6-4dd8-a42f-77d45c3f2e01","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.352344Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:eafcf3fd9c90a0c550efcbdce2feed6bbc833204303d0c61a50a534216f8ef98","observation_id":"57d015c5-2614-4081-8fbc-ef1c06409793","resolution":{"observed_at":"2026-08-12T00:50:20.099459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.080824Z","title":"Next-generation networking and edge computing for mixed reality real-time interactive systems,","venue":null,"work_id":"8ca25653-3d32-4f47-98c1-4749345d0c7e","year":2020},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.356200Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:df0ad1be09ee8ad69a0975368c257c1cd690b6cfe88b0fcd435e070b7500a0e0","observation_id":"0db091eb-cd22-4e25-9b2a-5515d36fb4b3","resolution":{"observed_at":"2026-08-12T00:50:20.086379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.066809Z","title":"An egocentric vision-language model based portable real-time smart assistant,","venue":null,"work_id":"91f4eced-9d44-410c-bf25-b0ed0ec84a37","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.360215Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:4e2e52a2cf507fc064c145e8078070f64492e6dbb81a617d1c6342b3d62da308","observation_id":"43a2847e-f2a4-4cdc-866c-3ed4e713706d","resolution":{"observed_at":"2026-08-12T00:50:20.071213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.364187Z","title":"Teaching LLMs to see and guide: Context-aware real-time assistance in augmented reality,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.364187Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:3353186097faea0b97a31dd2bfd9a0b5355fc7680a5883b355b5305faf25fd05","observation_id":"4cbd87af-581d-45c3-a2de-fb96d7c5dbfa","resolution":{"observed_at":"2026-08-12T00:50:19.364187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.052991Z","title":"Gartner predicts 80% of enterprise software and applications will be multimodal by 2030, up from less than 10% in 2024,","venue":null,"work_id":"a0ed781e-16af-4de4-9b70-b43802242d4e","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.368841Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:8010a7090f32a346cae4418e843e027c1cd053e96d7119ae41f2b64f2a8d8acf","observation_id":"3999f9fc-18db-49bc-85a5-767882c1d7fb","resolution":{"observed_at":"2026-08-12T00:50:20.057437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.372822Z","title":"Deep learning-based object detection in augmented reality: A systematic review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.372822Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a2891a17ccd5fdd6a8921c7354ee631a4614e2d52c7f5c0eedd884b36c7ecb81","observation_id":"9ad2d767-1a29-49bb-8fc9-b5b4f177566a","resolution":{"observed_at":"2026-08-12T00:50:19.372822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.031876Z","title":"Realtime API with WebRTC,","venue":null,"work_id":"603f7cfd-2c59-4d33-a5ca-ef77ab020254","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.376497Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:e24c22b2912bf86fdfb544ae5e6a8c5a502e336ffd0feccccbe1623ac6d33ed7","observation_id":"b3c695f9-5789-4416-885c-8d6bf76902b8","resolution":{"observed_at":"2026-08-12T00:50:20.036424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.016909Z","title":"Realtime API with WebSocket,","venue":null,"work_id":"41c2ea42-2725-4bf3-9be4-99492d5b042d","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.380300Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:d92640fea9081fd94d7a11b30a5084d18ab55f3ab88ebdabbf92b21887591429","observation_id":"2437408b-3e1a-4cee-9a4e-18cefaaabc6c","resolution":{"observed_at":"2026-08-12T00:50:20.022217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.999660Z","title":"Bench- marking the effects of operating system interference on extreme-scale parallel machines,","venue":null,"work_id":"32f73ae0-5347-4728-a889-b2289712031a","year":2008},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.384617Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:61dc13db5ddabed67feee4b906e99821cd753e8ceec2219d897450933bebf8ae","observation_id":"0b4103ae-d36f-4f62-b6d0-c6c63b65fa68","resolution":{"observed_at":"2026-08-12T00:50:20.006413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.986029Z","title":"Understanding the causes of performance variability in HPC workloads,","venue":null,"work_id":"b502aa95-007c-429a-a822-4ceb689d5cfd","year":2005},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.389165Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:cc36e20879eefdd03c452082279b4c0960542eefa03838108fc15afc22ba56ea","observation_id":"1f047041-fa3f-4727-9554-0090e9e3532e","resolution":{"observed_at":"2026-08-12T00:50:19.990984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05491","last_updated":"2024-11-08T11:43:40Z","snapshot_observed_at":"2026-08-16T13:01:47.638453Z","submitted_at":"2024-11-08T11:43:40Z","title":"Overhead Measurement Noise in Different Runtime Environments","version":1},"cited_work":{"arxiv_id":"2411.05491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.05491","snapshot_observed_at":"2026-08-12T00:50:19.459574Z","title":"Overhead Measurement Noise in Different Runtime Environments","venue":"cs.PF","work_id":"38d22c6b-ea95-4499-8321-2c5142df3319","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.392944Z"},"links":{"cited_paper":"/paper/2411.05491","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:93231eb2e95d1323abed5fd8c0885657f8c748dfb4f23a63848e6de43eea3646","observation_id":"129c06b6-3e73-46a7-b6b0-c9eac695ac01","resolution":{"observed_at":"2026-08-12T00:50:19.466260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.972142Z","title":"Using microbenchmarks to evaluate system performance,","venue":null,"work_id":"117e4358-6763-40b4-813a-99e39815e2c4","year":1992},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.397014Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:d880f01b8e01b5d033fd1c474db0a25b1e171adc4e1f94fd67edb67692c2257b","observation_id":"b5e9adb5-74f6-44ab-8670-c8f301c10ab1","resolution":{"observed_at":"2026-08-12T00:50:19.976627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.957311Z","title":"Beyond inference: Performance analysis of DNN server overheads for computer vision,","venue":null,"work_id":"9fa12a0f-ea29-4344-88da-22ba6d5480a1","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.400903Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:d0a7603f1577ce04d3847cba487caaf01dc20af6ed48fbae0ff54f8e963dc2f6","observation_id":"308695cf-3a57-4dd8-945a-a254dd5502f4","resolution":{"observed_at":"2026-08-12T00:50:19.962037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.944342Z","title":"EdgeYOLO: An edge-real- time object detector,","venue":null,"work_id":"74e74146-0f10-4604-86ca-1078a22890f8","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.405290Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:3d4a6ef7575a9d06eac63140d9ba5c890f2a582f0691eaea8865f35ff9f8943b","observation_id":"199f6712-add6-4936-95dd-b41d3f3fd1a6","resolution":{"observed_at":"2026-08-12T00:50:19.948887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.930175Z","title":"Images and vision — calculating image tokens","venue":null,"work_id":"23f98a67-14ff-4012-b55c-91a10b1c9987","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.409358Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:87323fb3888f1ed0b5ddc2f793c0d5595ef163b9b769c873998f43bde2653e82","observation_id":"464bb5f5-a174-40fb-860b-14cfe70ae457","resolution":{"observed_at":"2026-08-12T00:50:19.935016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.915735Z","title":"Per-part media resolution (Gemini 3 only)","venue":null,"work_id":"4954235a-709c-4f14-9aaf-c07ff640b22e","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.413398Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:d27e9b66a09ac84eac650555b771b594c28e357dd7c3fcbd560ad583e61f71f0","observation_id":"7d4d740a-2e86-46f3-b44f-b283bba3fcf4","resolution":{"observed_at":"2026-08-12T00:50:19.920442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.899881Z","title":"Gemini 3 Flash — model documentation","venue":null,"work_id":"1ddb10df-455d-4af1-8317-96115ea7da2f","year":null},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.417282Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b4af03d7400639b1f1ead5ffe6ae914aa09fe2cae3d0515868fe5baffd58e0d3","observation_id":"279c4101-1146-4c54-a220-213d08828304","resolution":{"observed_at":"2026-08-12T00:50:19.904265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.872146Z","title":"Gemini 3 developer guide — generateContent API","venue":null,"work_id":"1d0c15c5-152d-45e4-a790-8c3cebb530b4","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.424861Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b2d0ccdf4b39047ec5294d844cabd430696f9cd45bc2692ec25f163da435bca4","observation_id":"6e963d5a-b3a1-4dab-97b1-0a1dc045532d","resolution":{"observed_at":"2026-08-12T00:50:19.877165Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.886935Z","title":"Accessed: 2026-05-28","venue":null,"work_id":"230653da-cc46-421c-9f28-7ba2278ce1f9","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.421183Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:e0c63fb4f3b59a9c0306b2e49684cd29b138ee1f5091a6b0785b425c83111e32","observation_id":"b0674577-89e0-4df8-88f0-db6abe44eb2d","resolution":{"observed_at":"2026-08-12T00:50:19.891144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T16:08:07.187646Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":6,"verified_fuzzy":62},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2608.07861."}