{"as_of":"2026-08-06T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57b02b9e913f615f9659e6a424f102cd26d3d0ade73a61fc1769b2bc2db86d58","coverage":[{"denominator":158,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T11:12:41.130806Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T22:19:38.973091Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09082","snapshot_observed_at":"2026-07-14T22:19:38.973091Z","title":"Ava- bench: Atomic visual ability benchmark for vision founda- tion models.arXiv preprint arXiv:2506.09082, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12433","last_updated":"2026-06-02T23:51:35Z","snapshot_observed_at":"2026-07-14T22:19:37.680401Z","submitted_at":"2026-03-12T20:33:19Z","title":"Revisiting Model Stitching In the Foundation Model Era","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T22:19:38.973091Z"},"links":{"cited_paper":"/paper/2506.09082","citing_paper":"/paper/2603.12433"},"observation_digest":"sha256:2edbc4a898559b8affe97e3b1a16548770be5e9da0aa59dde3affa76b6d4d9bd","observation_id":"5e2c7784-6a4f-44c5-9b7c-acb1a08a2ebb","resolution":{"observed_at":"2026-07-14T22:19:38.973091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09082/citation-record","integrity":"/paper/2506.09082/integrity","json":"/paper/2506.09082/citation-record.json","paper":"/paper/2506.09082"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:7075afec411087b65229d82d16d487557bd2244206dcc22a0aa36bb7c567705b","observation_id":"437a8071-a879-40b2-94a4-b357927457f6","resolution":{"observed_at":"2026-05-19T11:13:02.837360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foundation models defining a new era in vision: a survey and outlook","venue":null,"work_id":"453265a9-6798-40e4-8d96-25e164051af4","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:c2d05cce8c93cd7269defc9cffc00da44d3e74cf6da42a4984c2f790a88fd365","observation_id":"b7803521-163e-40d4-9ffa-3c0623ce07ba","resolution":{"observed_at":"2026-05-19T11:13:03.052914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10566","last_updated":"2024-09-13T18:01:49Z","snapshot_observed_at":"2026-08-04T21:18:01.167360Z","submitted_at":"2024-09-13T18:01:49Z","title":"Eureka: Evaluating and Understanding Large Foundation Models","version":1},"cited_work":{"arxiv_id":"2409.10566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.10566","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eureka: Evaluating and understanding large foundation models","venue":null,"work_id":"ff2b4604-378c-441d-8c92-805e6852b3dc","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2409.10566","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:a7b8705f2d3b80e24f87257e017352791e77292808089ab7a164d0b795baa730","observation_id":"8286d9f7-720f-4b99-9349-4e1d4a0063a6","resolution":{"observed_at":"2026-05-19T11:13:02.874659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene text visual question answering","venue":null,"work_id":"a53f606a-bcc2-45b3-9bfd-475b521ab931","year":2019},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:d516656b95b91c0b6601feb7ca3910b3d51a880be8b560d4a185b3a2118f9c84","observation_id":"08a5b9b2-fb20-4a66-9bb4-73927304f280","resolution":{"observed_at":"2026-05-19T11:13:03.033241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:53732bfd81d0c6988964722c3fe2ee9f8e9a710235547c923074131b82fa6d2e","observation_id":"68c006e2-0e69-42f3-909e-e0f73ecc247d","resolution":{"observed_at":"2026-05-19T11:13:02.890234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"4148a8de-8657-4f01-b507-1d58fd9c3101","year":2021},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:81d7e2122bffbdd4903458feb0ffa64520cafbd2149c345f2f5eddac85652de4","observation_id":"6ce07b22-b15f-4c6d-85eb-bba5f39b38c4","resolution":{"observed_at":"2026-05-19T11:13:03.040320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decomposing complex visual comprehension into atomic visual skills for vision language models","venue":null,"work_id":"91b12901-f836-4b2c-b532-a57df0b99e52","year":null},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:a98aea45b2cb3edb82c5883fee8aa84e65092586b7da9350d0958c30f912ef64","observation_id":"3999625d-bc2c-457b-adac-093c94514c8e","resolution":{"observed_at":"2026-05-19T11:13:03.017518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"a5cb5e3d-452d-497b-9415-1ed1ae909e82","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:32b78be0972ba87e0c16cafde940869f568e45675c7c75fd4194409c9d25ec09","observation_id":"92cc5132-7175-4c94-a15a-9ce0adad6381","resolution":{"observed_at":"2026-05-19T11:13:03.068609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05803","last_updated":"2023-11-03T18:35:19Z","snapshot_observed_at":"2026-07-06T15:25:20.488824Z","submitted_at":"2023-05-09T23:24:09Z","title":"Segment Anything Model (SAM) Enhanced Pseudo Labels for Weakly Supervised Semantic Segmentation","version":4},"cited_work":{"arxiv_id":"2305.05803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.05803","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything model (sam) enhanced pseudo labels for weakly supervised semantic segmentation","venue":null,"work_id":"59310ccd-79dd-4890-8637-9749c4712525","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2305.05803","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:5ef69add54694bb1eb74cdb103b9a6d751a5abf5b2af8ec08d55b60bfec1f889","observation_id":"279d5f37-ea74-49f7-8507-b45140b68e69","resolution":{"observed_at":"2026-05-19T11:13:02.896114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:2aad0a8ad8e546292091ef57061381d66036222de0a751e6cd7fa6a723afdfc8","observation_id":"720ed980-043f-4937-95ef-8c99458adeaa","resolution":{"observed_at":"2026-05-19T11:13:02.812538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19930","last_updated":"2025-08-27T15:21:58Z","snapshot_observed_at":"2026-08-03T23:42:29.864142Z","submitted_at":"2024-11-29T18:42:28Z","title":"On Domain-Adaptive Post-Training for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2411.19930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19930","snapshot_observed_at":"2026-07-07T18:14:03.449209Z","title":"On domain-specific post-training for multimodal large language models","venue":"cs.CL","work_id":"485bccbd-91d1-4cb9-a392-976b563f235c","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2411.19930","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:b0fd3bedbfc8404304d839d83f83a7e35fc1de513ab6aae12e851856a89146ab","observation_id":"6fd232ec-337c-4e50-9796-f460cee33860","resolution":{"observed_at":"2026-05-19T11:13:02.828424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03927","last_updated":"2024-12-05T07:06:17Z","snapshot_observed_at":"2026-07-06T20:01:59.108032Z","submitted_at":"2024-12-05T07:06:17Z","title":"MegaCOIN: Enhancing Medium-Grained Color Perception for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2412.03927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03927","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megacoin: Enhancing medium-grained color perception for vision-language models","venue":null,"work_id":"9a24e2bc-44e2-4f05-b0a9-4e0bebea9cba","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2412.03927","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:2486866b0cf397b4d7cb4744648542f5d43e1cd41181c24c364b57db705012b8","observation_id":"dd796da5-a3e7-4af0-afcd-154ddd1da6c1","resolution":{"observed_at":"2026-05-19T11:13:02.869014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"815cff7d-cce6-4360-ba9e-2c1f9f716e29","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:a86cbffef2a6ef2c74fc0092347fda972f1cd6055869e6281f8fabeb556ac7c6","observation_id":"348c2c32-8dab-46db-9e03-282ad73bc4f9","resolution":{"observed_at":"2026-05-19T11:13:03.021070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-03T10:04:27.288236Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"cited_work":{"arxiv_id":"2501.09333","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09333","snapshot_observed_at":"2026-07-04T00:09:15.243898Z","title":"Prompt-cam: A simpler interpretable transformer for fine-grained analysis","venue":null,"work_id":"e7871945-1bb4-4991-b57f-88054a5b1062","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2501.09333","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:e8c1b88d8415c2e1f442df0a27bec36f7fc8a706f08c6222de19c5aff14c6d39","observation_id":"e04d3eea-4b88-4095-b940-aa224aff8e83","resolution":{"observed_at":"2026-05-19T11:13:02.882874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cimpoi, S","venue":null,"work_id":"8b8939ac-c275-48be-8d5c-c45c0df1c224","year":2014},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:92050d60ac679f9e811218694849e753518f24236ca98f60721b4b87ac7172e4","observation_id":"4c968fa0-f649-4219-90fb-859a301ebe34","resolution":{"observed_at":"2026-05-19T11:13:03.120546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Humanvlm: Foundation for human- scene vision-language model","venue":null,"work_id":"99bdb420-a7eb-4f7a-950d-96c0f6ad7aad","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:70484907f6ed9ae3eac32c3bb84f9bce33e2e36dae55b7d5ba3b5e53771b226a","observation_id":"114f337c-b6ee-4faf-9bbd-9834a1597742","resolution":{"observed_at":"2026-05-19T11:13:03.115722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:103a3aa98e93c4decc9193726251cce22a1b22dc6a7a46e06ff8fe3b0cda3562","observation_id":"0f0ea91a-202e-4131-8681-5cf6fd4cb4dd","resolution":{"observed_at":"2026-05-19T11:13:02.885253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shape and texture recognition in large vision-language models","venue":null,"work_id":"9a574a0a-1d30-4f40-be81-4c55d00bb377","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:8d5a0ca04d8742d7c839545305bde81c81ddbe303f1ed63bd792965b5209b538","observation_id":"28701936-19fc-490e-a422-603c0e74bd02","resolution":{"observed_at":"2026-05-19T11:13:02.857949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15288","last_updated":"2024-11-22T17:00:18Z","snapshot_observed_at":"2026-07-06T19:55:46.467982Z","submitted_at":"2024-11-22T17:00:18Z","title":"There is no SAMantics! Exploring SAM as a Backbone for Visual Understanding Tasks","version":1},"cited_work":{"arxiv_id":"2411.15288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15288","snapshot_observed_at":"2026-07-03T03:07:35.466177Z","title":"There is no samantics! exploring sam as a backbone for visual understanding tasks","venue":null,"work_id":"cdddb907-5ff1-467d-a10f-58c4bc507cda","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2411.15288","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:67e0f30c703dfbdd0878ca4f8540dcc3d780c411412658834c3d1c72f32b8ae6","observation_id":"4edbc07f-e1d9-452f-b859-a0d647a0a8a2","resolution":{"observed_at":"2026-05-19T11:13:02.883068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-07-06T20:13:31.499259Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"cited_work":{"arxiv_id":"2412.19406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19406","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mllm-sul: Multimodal large language model for semantic scene understanding and localization in traffic scenarios","venue":null,"work_id":"9bf2f8e1-7931-40cf-9aed-7e15f28e4f5e","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2412.19406","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:d3954524a4f3a3c50246bf2a7c2752fb4a1cbf495618bf0c07ad884e15897e49","observation_id":"14ee273e-135e-47aa-9a9f-7a009c3d6e88","resolution":{"observed_at":"2026-05-19T11:13:02.893274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":"2411.14402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal autoregressive pre-training of large vision encoders","venue":null,"work_id":"1982a4f1-7cdd-448e-8ddd-85cd782e6e17","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:b3843ae765c553c6f22cbe9b32be2080e7ebda3b964a4dc6739cd215e2db4c69","observation_id":"8f3a1ec8-383f-4a72-92bd-bacd9751eb5e","resolution":{"observed_at":"2026-05-19T11:13:02.851822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"0eda63b6-be43-44f3-a253-d5fcad6d0e50","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:6079afe6fd188ff4497798687e77076c96322dfb863d36363f66de750321bbd6","observation_id":"c7e1e9ca-418f-4a91-ae97-22de8b9f90ac","resolution":{"observed_at":"2026-05-19T11:13:03.089464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09193","last_updated":"2025-03-05T19:01:00Z","snapshot_observed_at":"2026-08-04T05:28:06.955488Z","submitted_at":"2024-03-14T09:07:14Z","title":"Can We Talk Models Into Seeing the World Differently?","version":2},"cited_work":{"arxiv_id":"2403.09193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09193","snapshot_observed_at":"2026-07-10T15:47:23.264103Z","title":"Are vision language models texture or shape biased and can we steer them?","venue":"cs.CV","work_id":"1b7e52ac-dfa8-4fa9-8cdd-bd704ce60c42","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2403.09193","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:3a37d223d5cae386bf1db615437e07f5481fe3d9bca71f789aa3b0fe35ae8c82","observation_id":"6b402099-349e-4aec-86e3-ab2dafd7eae3","resolution":{"observed_at":"2026-05-19T11:13:02.855394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":"904b9e00-ecd1-4267-bfcd-2ac2ff6d08a4","year":2013},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:3915945f714a431fec721d9ac7e91c118145c4b03dcbdde2a5c97ef55b2d042f","observation_id":"1349b0e5-2b4d-4536-acce-60f3a83c11c7","resolution":{"observed_at":"2026-05-19T11:13:03.049252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Battle of the backbones: A large- scale comparison of pretrained models across computer vision tasks","venue":null,"work_id":"39e96baa-1df8-4333-a99f-b525eec6b127","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:0317fd1b89d6873a8c73a53e0337de7396b26530395146e717d8f5093f81e1f0","observation_id":"84c79353-0db4-4b05-8878-4e830072408b","resolution":{"observed_at":"2026-05-19T11:13:03.098323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"2913136b-83ed-45a1-bc3b-0d6d8be6e866","year":2017},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:de5a7937a7f7edea8c043912373489540a14a7055295f5361956d7d3c49ba2e5","observation_id":"71a977c4-dd80-4fb7-a8ec-e2e7c1c92d02","resolution":{"observed_at":"2026-05-19T11:13:03.113924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answering","venue":null,"work_id":"5e77c87d-db27-4d7f-8868-ee9f4da592c9","year":2017},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:9cc32e97c86e6636d5044ecb4c5e159db58f044d59b1937aabe15ea8571fd1bd","observation_id":"dab1989f-8231-43f9-901a-70790b83010a","resolution":{"observed_at":"2026-05-19T11:13:03.059969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:f520525ac833d285da6d4747bb0804f6bcf879c5ca5d67c1eea74d0a6387d949","observation_id":"761f0e06-25f8-4d87-8ab4-5b96ba627dcf","resolution":{"observed_at":"2026-05-19T11:13:02.808841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23883","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:19:37.977157Z","title":"Bioclip 2: Emergent properties from scaling hierarchical contrastive learning","venue":null,"work_id":"c19d12c0-d3c8-4305-844a-83640e2b289a","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:edee17c5578c08e72e91007738436f47c6a8981364ee46159c81daa1cb85105f","observation_id":"a23c15d7-6a06-4f51-919b-64c884ff4908","resolution":{"observed_at":"2026-05-19T11:13:02.798927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"75a7d78d-0b09-443e-afd7-f056b0895848","year":2019},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:2520a86e10dacfd88d37d0f7a3bc948fd64e4c9075e835d801104c43d3576c2a","observation_id":"938290bf-92e8-4df5-b001-a3d7ad78e1af","resolution":{"observed_at":"2026-05-19T11:13:03.047900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on vision transformer","venue":null,"work_id":"e5755c7b-fa76-4e1d-9073-1e681ac60d97","year":2022},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:1718dc71b96b91b93b4a91b54278f98eebd5dae88feb1a40be4140205f6b9d56","observation_id":"10c56288-30be-4fef-95c6-3fbda059ac18","resolution":{"observed_at":"2026-05-19T11:13:03.036431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07679","last_updated":"2025-02-09T15:03:08Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T17:06:41Z","title":"RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models","version":2},"cited_work":{"arxiv_id":"2412.07679","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07679","snapshot_observed_at":"2026-07-02T02:16:26.492248Z","title":"Radio amplified: Improved baselines for agglomerative vision foundation models","venue":null,"work_id":"a68b0fd4-1026-4dad-a3b5-6b2cc5328a08","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2412.07679","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:9f1b1cd9c634877c0303a2ffcac54f1092028288cb953f51697d41f4931b3b43","observation_id":"581289eb-d9d6-4aba-9543-f16e2f48ab58","resolution":{"observed_at":"2026-05-19T11:13:02.805685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":"a0b49ae1-2239-4928-a2cb-b56ff8574363","year":2019},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:9e1f7b4d7b37e5497940c7390c3b3efd53f61624d8ed8fbd29dbb4669f7543df","observation_id":"587cdc6e-f774-46de-b132-eaef90308a44","resolution":{"observed_at":"2026-05-19T11:13:03.014019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drone-based object counting by spatially regularized regional proposal network","venue":null,"work_id":"9d4a7896-8762-40f3-a05f-5d61297bed8b","year":2017},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:b7883f5550f792296d51554ff92c54187ce01abf58cbfb16a7de21d3b0892c23","observation_id":"12c3d566-fafb-456e-9f18-c08253b40c1e","resolution":{"observed_at":"2026-05-19T11:13:03.021238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"60837e0b-8646-47db-82de-3e070282c687","year":2022},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:e87acdd85d7aa62d20c8a8e0f64d5bb513eb6dc5618128f7d0669b262d2ebd77","observation_id":"ec97031c-663a-4160-872b-faab2438c3e8","resolution":{"observed_at":"2026-05-19T11:13:03.113477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15769","last_updated":"2024-08-28T13:05:55Z","snapshot_observed_at":"2026-07-06T19:07:07.234443Z","submitted_at":"2024-08-28T13:05:55Z","title":"A Survey on Evaluation of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2408.15769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15769","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on evaluation of multimodal large language models","venue":null,"work_id":"319b06ca-1ddb-41da-b7a6-7b8152c3a443","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2408.15769","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:7cc257b5f7aefa74453089cac01dcc9d554470cbc21c9a8079dfb60abba96a90","observation_id":"f09d3e57-92b7-4da0-9496-38c4d707aeac","resolution":{"observed_at":"2026-05-19T11:13:02.831115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"b61efc9c-034f-4d67-b92c-1230f9468ad1","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:888fe965dbd383b168f4e5987c0c096cf9b02b7322cb3b5c83c35cc8a9cb947c","observation_id":"2f3652a3-a196-47f5-8dfe-c0797ad7d866","resolution":{"observed_at":"2026-05-19T11:13:03.079154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17163","last_updated":"2026-05-26T01:50:12Z","snapshot_observed_at":"2026-07-06T21:28:52.660414Z","submitted_at":"2025-05-22T15:25:14Z","title":"OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning","version":2},"cited_work":{"arxiv_id":"2505.17163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17163","snapshot_observed_at":"2026-07-04T21:00:09.510505Z","title":"Ocr-reasoning benchmark: Unveiling the true capabilities of mllms in complex text-rich image reasoning","venue":"cs.LG","work_id":"049a1737-1d31-4d8f-9fe2-6232eb147ff8","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2505.17163","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:f546e9edd69472547d5cdd95a6923aed8ec4ef4bd9445a259fc0b469ad408ae5","observation_id":"3b18747c-e5c2-4e08-b29d-f0194bff28b1","resolution":{"observed_at":"2026-05-27T02:04:28.324233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Position: The platonic representation hypothesis","venue":null,"work_id":"ea8a3c9a-bab1-4026-ae05-4ba14d5dc337","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:6aab62be4314a1ec7eb6dba21dc1c26f26c2988f9e9ad03210931f6824d9ac79","observation_id":"0adf2cfe-40d1-4484-a6cd-278204a07da3","resolution":{"observed_at":"2026-05-19T11:13:03.105719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16761","last_updated":"2025-03-29T09:24:00Z","snapshot_observed_at":"2026-07-06T19:56:48.086175Z","submitted_at":"2024-11-24T15:07:47Z","title":"Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2411.16761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16761","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is’ right’right? enhancing object orientation understanding in multimodal language models through egocentric instruction tuning","venue":null,"work_id":"d75495f4-481a-4ec1-a4b5-31d7d825951b","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2411.16761","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:ae43fe2601cb1a7330dbfa66e69b5222de483c7c55a703aaf5961d8081f48a6b","observation_id":"f9d7873b-8f6f-47f2-8402-09bbd1246c7f","resolution":{"observed_at":"2026-05-19T11:13:02.890631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers in vision: A survey","venue":null,"work_id":"e9bb8dcc-d2e2-481a-84a2-2b673ce2d934","year":2022},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:8c24e79f146e2aec4af5675a9c9a1ad10477a8632573801273613d695dc61dbc","observation_id":"c088ac66-75f3-42bb-8ec2-5d2aeabd789f","resolution":{"observed_at":"2026-05-19T11:13:03.056263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mllm-compbench: A comparative reasoning benchmark for multimodal llms","venue":null,"work_id":"e57878b8-771b-44cc-b469-f5093972c1a2","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:11cc04d60e5c00f5e7b85e7865194be91aa040f08d8eadff1ad0df62b9e8a122","observation_id":"90af026b-3dbf-4772-bc01-fbf76c449e15","resolution":{"observed_at":"2026-05-19T11:13:03.027988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finer: Investigating and enhancing fine-grained visual concept recognition in large vision language models","venue":null,"work_id":"c41d6a91-5e8b-4338-b1a9-51c9a8ea2183","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:0258194d172954169df09927e625cf7fd71a2ca55c4f14315a644d4b619ee8f9","observation_id":"d60c2d93-3d20-4f62-b0e5-6a5ccfc3a5f6","resolution":{"observed_at":"2026-05-19T11:13:03.100148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.204657Z","title":"Segment anything","venue":null,"work_id":"ccc0c322-2f90-4398-aaac-1d329cfcf543","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:aa538cbcf0512d280bb6e7fb6a250f382502e3106e921b14ddd7cbd473a21e43","observation_id":"c4205e3f-d4cf-4898-a504-05a1c8e043fc","resolution":{"observed_at":"2026-05-19T11:13:03.063129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diagnostics- llava: A visual language model for domain-specific diagnostics of equipment","venue":null,"work_id":"dbaa7e89-11d1-4c1e-bbcc-29e63c397b97","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:9263b6de2fb1e5b56a463285cbbc08d4db925dd0fa7af25b9e554b95cd014a30","observation_id":"2780cd61-b304-4fe8-b521-a2eb3f05ae84","resolution":{"observed_at":"2026-05-19T11:13:03.112116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kylberg texture dataset v","venue":null,"work_id":"9d9b0761-56cd-4681-969d-0bdf7d1bc5b3","year":2011},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:7b3e4a4a555b0f40f81f1627d766fe58fb7bc201d7a3809b2eeb9c519769ce36","observation_id":"36929f7f-0e8c-4f36-93ac-32430d2e1063","resolution":{"observed_at":"2026-05-19T11:13:03.073553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16209","last_updated":"2024-11-11T13:56:30Z","snapshot_observed_at":"2026-08-05T23:54:24.966325Z","submitted_at":"2024-09-24T16:09:29Z","title":"LLMCount: Enhancing Stationary mmWave Detection with Multimodal-LLM","version":2},"cited_work":{"arxiv_id":"2409.16209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.16209","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llmcount: Enhancing stationary mmwave detection with multimodal-llm","venue":null,"work_id":"5f5d4ce7-b7ff-4dd0-b359-20b4717d9922","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2409.16209","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:ba8d503db6f49a9ebbf3eff732465b83fde67a5f79f2427414370a445b57a790","observation_id":"91724a07-6f19-46b8-862a-18de7a7caa48","resolution":{"observed_at":"2026-05-19T11:13:02.815623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00574","last_updated":"2025-02-04T07:57:52Z","snapshot_observed_at":"2026-07-06T18:08:13.456457Z","submitted_at":"2024-05-01T15:25:54Z","title":"EALD-MLLM: Emotion Analysis in Long-sequential and De-identity videos with Multi-modal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.00574","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00574","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eald-mllm: Emotion analysis in long-sequential and de-identity videos with multi-modal large language model","venue":null,"work_id":"800b0c21-076c-40ee-849e-c0d86c1cafa4","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2405.00574","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:bd6a2e1a9dbe780162c8c03cae5b1be3c446473f6d58d9578e8614b652b2090c","observation_id":"2f785da9-4afd-42d3-9533-0324a7c94836","resolution":{"observed_at":"2026-05-19T11:13:02.783885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video crowd localization with multifocus gaussian neighborhood attention and a large-scale benchmark","venue":null,"work_id":"8764c06f-56b7-4348-a7e1-245fde22cd9f","year":2022},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:48e5533d64671b0f062e4a44d1d7f65438144dbf1830a5d6b9bdd1f9e07306b8","observation_id":"4d6fc00e-e34a-432f-ad90-da15443ca303","resolution":{"observed_at":"2026-05-19T11:13:03.034870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object detection in optical remote sensing images: A survey and a new benchmark","venue":null,"work_id":"4b91a3d2-b943-4244-b48b-b0c2e7642c55","year":2020},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:cce6363b7cb62c0d47343c26a6febe80d91526df3e40417636d9e6f5c38b6d20","observation_id":"92e62d28-3d9d-4cbc-816d-387002fdbab4","resolution":{"observed_at":"2026-05-19T11:13:03.024570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reliable crowdsourcing and deep locality-preserving learning for un- constrained facial expression recognition","venue":null,"work_id":"a8fb6622-bb5d-4a07-8a64-434009060772","year":2019},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:93055e4cf67b256817f605fdd544abda0ae33fca9a6ed7f3d11dafdd0c9d354e","observation_id":"bee65464-8792-4404-b280-dd0755252bec","resolution":{"observed_at":"2026-05-19T11:13:03.084431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04601","last_updated":"2025-05-07T17:48:35Z","snapshot_observed_at":"2026-07-06T21:20:26.707391Z","submitted_at":"2025-05-07T17:48:35Z","title":"OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2505.04601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04601","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openvision: A fully-open, cost- effective family of advanced vision encoders for multimodal learning","venue":null,"work_id":"c53f2026-e14e-4e68-beb9-bb9ee6763497","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2505.04601","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:51bb36e4092d5c9364d77f45f174c894aec9d176661bf857713c4948f8c12bfa","observation_id":"d4b948b0-1000-47c2-baf9-0a7d7665ae36","resolution":{"observed_at":"2026-05-19T11:13:02.865609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-07-06T20:16:53.338035Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":"2501.02765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Large Language Models for Generalized and Specialized Applications","venue":null,"work_id":"fb42c3c0-b890-4fb0-aa82-802aa04ecd2c","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:9479abf62904ec44f96a07d6d9098a830c9a5a5039c75191d2bbe987d01cd0a0","observation_id":"78c8ddaa-47de-4843-8a1b-958b2fea1532","resolution":{"observed_at":"2026-05-19T11:13:02.863394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expression analysis based on face regions in real-world conditions","venue":null,"work_id":"2bd484ee-b548-48a8-9488-ccb9f9d33fed","year":2020},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:2912b6de25b88ad75fb33d796286bfcea91a3113ac9d2843ba86e06aca5fe346","observation_id":"235fe6d8-1aa0-4bd6-a9f3-78d964c14141","resolution":{"observed_at":"2026-05-19T11:13:03.096485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.06284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:09:55.357834Z","title":"A comprehensive survey and guide to multimodal large language models in vision-language tasks","venue":null,"work_id":"9d2f4c9a-2899-4303-9473-10f1f8a62dfa","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:fd3272d2f1deeb667b871824f583bdfbc16dd44686ff4ebec492d22479c392ed","observation_id":"2c457a82-0bc7-4ae8-a8da-7d3184341a90","resolution":{"observed_at":"2026-05-19T11:13:02.833937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"e78836e1-c858-4a4c-94f7-f2d0b54b65ad","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:63dde7c5f43d72b43589d802facbfe89dc7f8ce12200b84c1fece0b8b86ab6c1","observation_id":"5634bf49-ca72-46da-807e-9fb3bc46e823","resolution":{"observed_at":"2026-05-19T11:13:03.109478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"dcdcf21b-845a-4f46-a589-fca57453146a","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:3c1e8a1d010f3738c0077546ca11039eea4db83e1962dbf699826e5ce05da0af","observation_id":"eaa0e79a-a998-4364-b3c5-60d2f61f302b","resolution":{"observed_at":"2026-05-19T11:13:03.012035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cvpr 2020 continual learning in computer vision competition: Approaches, results, current challenges and future directions","venue":null,"work_id":"0c1c0286-1243-48b6-a3e0-ed73aac7f13c","year":2020},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:42c4e4af539edfab6b9a20efdf88eee37833cf40f75527d74a9636621b8322df","observation_id":"629a158d-0e98-4440-aa15-752af39e5a47","resolution":{"observed_at":"2026-05-19T11:13:03.023017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The development of the cie 2000 colour-difference formula: Ciede2000","venue":null,"work_id":"b57553ec-b9b5-4fdf-a965-293354be8192","year":2000},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:f0d20b32b5d86b641528a6531df3ffbfac45d9fe0ecf3a81234be258f302bfb8","observation_id":"7959ce49-47a4-46f1-92a9-9abd5f30d7b4","resolution":{"observed_at":"2026-05-19T11:13:03.115407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning is fine, if calibrated","venue":null,"work_id":"063dc4c2-33e1-4f50-a734-be376d7d03db","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:11ce139acdb24c38ea4027c8409101d6f80569568d53f1cfd7e91a394dbce5f5","observation_id":"9d991c58-b310-4351-8e5e-b96c42ec8568","resolution":{"observed_at":"2026-05-19T11:13:03.122446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05683","last_updated":"2020-07-11T05:20:09Z","snapshot_observed_at":"2026-07-06T09:37:21.014976Z","submitted_at":"2020-07-11T05:20:09Z","title":"Batch-level Experience Replay with Review for Continual Learning","version":1},"cited_work":{"arxiv_id":"2007.05683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.05683","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Batch-level experience replay with review for continual learning","venue":null,"work_id":"b08334a9-8c3d-4762-a9e4-554b3dc6b70c","year":2007},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2007.05683","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:92680d12224e298af33f09f6d4900098c2b40ecf283fd6e47bd67a72fc84661a","observation_id":"90165c19-b3b1-419c-a4fb-96263d7bc45a","resolution":{"observed_at":"2026-05-19T11:13:02.840356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online continual learning in image classification: An empirical survey","venue":null,"work_id":"53af1577-3ee5-4e23-8b7b-7a4180f6e7a4","year":2022},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:5f0931508f7c6f9fb1e9ff7e67cd8cf538cca972ca000ff209141fdff9cd5cd0","observation_id":"bc806bbd-a42e-45c5-8bd5-0929314470f8","resolution":{"observed_at":"2026-05-19T11:13:03.069356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Supervised contrastive replay: Revisiting the nearest class mean classifier in online class-incremental continual learning","venue":null,"work_id":"ac57c48a-4058-4283-8680-35de4f42132c","year":2021},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:fc40d14e8d8b8ff4866e9f6d74d8d00dbf7e3e70800904fbc2d316afd5f7f5c1","observation_id":"63a3c159-cb68-4ac3-9f4d-fd6dc5045147","resolution":{"observed_at":"2026-05-19T11:13:03.107677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lessons and insights from a unifying study of parameter-efficient fine-tuning (peft) in visual recognition","venue":null,"work_id":"f812d6ed-080e-4209-8536-42085131e54d","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:bf33d50d3dad83bfbbffc4ac2e42a3b8898ebad02a729e4b586822596cea0567","observation_id":"258241d7-3370-43ee-a30f-ed82d10371bc","resolution":{"observed_at":"2026-05-19T11:13:03.104107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":"1306.5151","doi":null,"metadata_source":"pith","pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-07-11T03:07:53.092922Z","title":"Fine-Grained Visual Classification of Aircraft","venue":"cs.CV","work_id":"ed360110-3ce4-4959-8c74-1785cd9e537d","year":2013},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:3fae1893c1d61514c9b73636fb345f3bbdb9a0712010f57bfb6e096363a1df01","observation_id":"3e61a3dc-c11f-49cd-b0f1-a526db319c9c","resolution":{"observed_at":"2026-05-19T11:13:02.885453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The kth-tips2 database","venue":null,"work_id":"b1514e7e-b482-4058-86a1-6bdcf1cdbc0e","year":2006},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:4023852280d81139de18ae8450eda7f432e9d216ea813e37adb03240d8fba694","observation_id":"58126c4a-9a57-4fff-acee-edffef7b7dbe","resolution":{"observed_at":"2026-05-19T11:13:03.074240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical interpretable vision reasoning driven through a multi-modal large language model for depth estimation","venue":null,"work_id":"0c6b3eac-d4e0-41a9-ab05-dd73ab9cb903","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:f0f5055b8675a3ca1475541a03f7c2295043494de03627f229b4ae9158471770","observation_id":"c52d5607-8014-40b7-9097-c57445bb0ab4","resolution":{"observed_at":"2026-05-19T11:13:03.071893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mishra, K","venue":null,"work_id":"b01e0b39-40d5-4de1-8a0f-c448a4aa91a0","year":2012},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:b07d17d4f30b62af3b8ca7bc6f6a24ec5c711c29a240996a49f8afdd651bae0d","observation_id":"c47b2d68-de1e-4a29-9b69-d2fcb5abfb89","resolution":{"observed_at":"2026-05-19T11:13:03.070887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moments in time dataset: one million videos for event understanding","venue":null,"work_id":"c5aec34e-1194-465b-9129-aca49e1eaed5","year":2019},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:a9379e929e70c5dc97e564535e7c17ab40fc975bebaba21c0f20921d9213fe58","observation_id":"81a9079f-32f9-43b1-9692-5c1966ee7e75","resolution":{"observed_at":"2026-05-19T11:13:03.087860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intriguing properties of vision transformers","venue":null,"work_id":"ebe630db-9c9f-4c04-8389-73cb5c76f207","year":2021},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:df9d01de493cd783b71486efd332874d0638aba8c3b20d9462c9ece103db2413","observation_id":"f407c0bc-cd9f-4746-b490-ae7dfeeaf049","resolution":{"observed_at":"2026-05-19T11:13:03.091320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:fed4259fc2abc3a6be4a38ca5d76898e555791bac7a579b870fae0b372e7b317","observation_id":"2bda31ff-adde-4223-ae84-e3c5287a7ff7","resolution":{"observed_at":"2026-05-19T11:13:02.898494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple interpretable transformer for fine-grained image classification and analysis","venue":null,"work_id":"a9b7acd3-841d-4de3-8b58-c01444f3b692","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:846ecefdf596b60f269e0ab60a5afe8371d6d98786192b564a117ebf0846daa3","observation_id":"2d451229-ee15-4655-8d1c-ddbf50c64bb7","resolution":{"observed_at":"2026-05-19T11:13:03.091054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.601106Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"b3ebbc98-2134-4751-aee5-59fd941251d8","year":2021},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:85cc82d35f23248193e9b5266e4d708179a2ff0e56f7fa6c42bdfc02e08b3c39","observation_id":"288c74a6-29f8-467e-bbfc-8561dc9f974f","resolution":{"observed_at":"2026-05-19T11:13:03.031518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"64e3f7ee-eae3-4835-b0cd-4690aa4ef94a","year":2020},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:866ca65235078bec1a57416a1341f03a591b7148cfbe4059160eae0cd86985de","observation_id":"c5a373b1-63b1-49f8-8f15-9c4fe9ceb839","resolution":{"observed_at":"2026-05-19T11:13:03.045654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to count everything","venue":null,"work_id":"e4a4a87f-ed55-47de-b3ea-ca9e19c21b10","year":2021},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:4b82ed8ef31ef900e3206083816599b3eddfe356e0245a052e0f378a715db419","observation_id":"61e4a709-cd34-4325-abbb-3a485ace0b03","resolution":{"observed_at":"2026-05-19T11:13:03.070155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"1705a1ad-e88b-49f2-8b67-b84d499efd1b","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:3c4bcc4535c02abec770252d073d30c862bddf91ce1364fc0bca6a91e2131b6b","observation_id":"ee6569a7-5989-4dbb-8918-d7ea671eb1f5","resolution":{"observed_at":"2026-05-19T11:13:03.094691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized intersection over union: A metric and a loss for bounding box regression","venue":null,"work_id":"fbdb1ada-f3e7-41af-b53c-45a00b3661e6","year":2019},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:463cc9833b81e7e1b24233e2cf5dd4bd1b8e2e1c0cab44015a56462db9e8bd66","observation_id":"0eb6ed2e-cad1-428b-ba80-9e926668f3ba","resolution":{"observed_at":"2026-05-19T11:13:03.054686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object detection with multimodal large vision-language models: An in-depth review","venue":null,"work_id":"fe7640df-0a96-4029-bc64-93880a03f620","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:6b5b1f40cc63048bfeb9f5319f2e0b80ae5d561bd581fbffcc1b41c9ff67f1c1","observation_id":"529d4ca2-5bc1-4922-8da1-c1ca9a9287dd","resolution":{"observed_at":"2026-05-19T11:13:03.033473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.696483Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"84acdc5c-5011-456a-b141-403c76c3b723","year":2019},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:b9c762c17f9dbc1480616baed772581cf85fb33027b1ce96f3d52a2028d4905b","observation_id":"0e2a7e22-46de-41bf-8050-c79d6cd5a24d","resolution":{"observed_at":"2026-05-19T11:13:03.022768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online class- incremental continual learning with adversarial shapley value","venue":null,"work_id":"86080b76-2a18-4cf1-93f2-b90b00c84d9e","year":2021},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:c072731127003302330ab3208200a9e922f60495c29909578c211fb94664618d","observation_id":"5fc250af-a27a-4e9c-aa01-363cd7d71db9","resolution":{"observed_at":"2026-05-19T11:13:03.100342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"9aaaec4c-6cff-456a-beff-4d7073d7bdd1","year":2012},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:e478578006b4379eb05ba3031f4b79d406ddc875d6244aed7bac97d761f554f9","observation_id":"a837bc62-ca33-4516-92ff-35b87f2b68ec","resolution":{"observed_at":"2026-05-19T11:13:03.001857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal large language models are effective vision learners","venue":null,"work_id":"285dd438-a33e-4360-9e6c-2e9bda96a461","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:5667a5ad32d0c39b434046120d4dc44aed59cdfc615f5a85da17b073ba47f0c8","observation_id":"bac7d0bb-d7cf-4d9a-91cd-326c1898d884","resolution":{"observed_at":"2026-05-19T11:13:03.045962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding multimodal large language models in actions","venue":null,"work_id":"618bcf2d-4ae5-4442-be6c-53aaba36062d","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:36124a9b8082e8180ced6084ad22c84a1e996e3c749d39ad5c329888ae099f78","observation_id":"a4c18339-ab8b-43aa-830f-6c9bcba4d52a","resolution":{"observed_at":"2026-05-19T11:13:03.119018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temel, J","venue":null,"work_id":"be30fcc0-b69a-4451-892d-460d605f2065","year":2018},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:880b275a65bb4b76aea09d09fa2a82cc1e342340c68cd16881405af429352c7c","observation_id":"d36839aa-c845-46ea-a942-ba82fe55cdfc","resolution":{"observed_at":"2026-05-19T11:13:03.041863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kth-tips dataset","venue":null,"work_id":"0de3a4c6-cbdb-4d5e-b5c2-93af9e3b16e4","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:f1241426c71f7bbc37e68d831b8915158c854e75a93420dd4ff0f52fa3c48555","observation_id":"f88cff89-3b75-46f4-8f65-0845fa473fc7","resolution":{"observed_at":"2026-05-19T11:13:03.042244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic segmentation using vision transformers: A survey","venue":null,"work_id":"d28d60fd-3163-4cf8-a392-e300fe7ea5de","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:e6316e0071adeaaa231aa4d9040845563c4bb7f21387252f9015de1354a0b2a6","observation_id":"dc319ec0-c93b-4a95-9bd0-8a77737afcc8","resolution":{"observed_at":"2026-05-19T11:13:03.026231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"dfe1577a-4104-46a9-950e-9519c9472e74","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:42c1199fe07230bd286ca35a555126d730c7aa45dbfd7b59c0e01021bb251085","observation_id":"df647130-248f-4f48-8cac-d6ddab8075af","resolution":{"observed_at":"2026-05-19T11:13:03.111846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.146258Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"c278311b-529a-41f5-b7cb-99db07fcf600","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:c745bcdd5d8deb9a91af9992c4607da850ecde29e09960ad12fd2bfcc47dd547","observation_id":"ac95146e-21d8-4074-b945-b0c5c5d71d14","resolution":{"observed_at":"2026-05-19T11:13:02.991510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:5119e34ee95cdf2432ddc2ce0465af3e5c269fdfa5b183de049c6a7e0e8198fc","observation_id":"d3ed9224-d83b-4860-9309-d5ac4fec49e8","resolution":{"observed_at":"2026-05-19T11:13:02.844036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistic transfer: Towards non-disruptive fine-tuning with partial target data","venue":null,"work_id":"fbd5f666-f36f-4ae0-a2f2-8f0dbaae9a54","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:72203a7b4d7d8b13903b54a34168e99917bc436236271c2c165b55c29be08dbe","observation_id":"334a8d07-268e-4315-b5cc-672a93d8d441","resolution":{"observed_at":"2026-05-19T11:13:03.101869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual query tuning: Towards effective usage of intermediate representations for parameter and memory efficient transfer learning","venue":null,"work_id":"d1b07ef7-a313-46af-b228-c498d474adf6","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:68f0a0f1008d6e7a9bad240e70bee68c7f52dff6c97ee7dce266ae31705bf61c","observation_id":"96ca5726-1e9e-46b6-a194-c8a2ec7c782b","resolution":{"observed_at":"2026-05-19T11:13:03.051304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking representation learning for natural world image collections","venue":null,"work_id":"355801c9-d41c-4828-987a-5e9b5b3dbf36","year":2021},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:04ddeea9be80347191d84d70ad7dbd21e850624b3b12a043c4e4ce602f745b1e","observation_id":"e962a679-52ab-4177-a821-94f2673b8beb","resolution":{"observed_at":"2026-05-19T11:13:03.092775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:ee00850ef86294c3d1103b8b6e3d4a866fc3be720b17bcdcd219b9053b1abed7","observation_id":"2c669783-fe6d-4e56-ba56-abe50041330b","resolution":{"observed_at":"2026-05-19T11:13:02.871922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":"796f7a35-626c-4f21-994f-8990294b45e9","year":2011},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:484a60f5cdbaafe34cee005a436639bcfaf78d6d2e829ad130e011e46e12853e","observation_id":"12569ffd-69b6-444f-a391-b50780b989e7","resolution":{"observed_at":"2026-05-19T11:13:03.054934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harnessing multi-modal large language models for measuring and interpreting color differences","venue":null,"work_id":"8da6b405-7158-494b-ae5b-f7ec4034e393","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:d31cb57868144e8aadd2dbd91054801536c57f2f44efd7611ed97f698caa3c76","observation_id":"28a70ba5-ed18-4be6-b4e3-910923c938c0","resolution":{"observed_at":"2026-05-19T11:13:03.096667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":"2505.23747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-07-04T16:39:57.786059Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","venue":"cs.CV","work_id":"389bb6a7-1369-4d6f-a808-838fa4f5b635","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:d3957429f8b99ecfff889b3f8b8dddbedf9eceb95dcd7ff59af14162483caec2","observation_id":"3cad97b3-0415-4738-a46f-b2c110d9613b","resolution":{"observed_at":"2026-05-19T11:13:02.859921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":"e558a4f9-c876-4ccb-a35e-7ad232438b8d","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:3bd7386d0e5b4c0ff05e90af4738a2032eb99c10cd6e10d81e6115e65957f687","observation_id":"d5c2b3b6-725a-4bcb-b5d1-1a95e099416d","resolution":{"observed_at":"2026-05-19T11:13:03.076991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal large language models: A survey","venue":null,"work_id":"21d08988-ce13-4340-b94b-225212e9447e","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:9e2b094b3ae86b63e7ff488a07c141ab148568100c9992c672d44fa9ee73be23","observation_id":"ff3c0eb4-d383-4fb5-86d5-06f5b357602a","resolution":{"observed_at":"2026-05-19T11:13:03.094882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21850","last_updated":"2026-05-14T18:32:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T17:57:22Z","title":"Visual Compositional Tuning","version":3},"cited_work":{"arxiv_id":"2504.21850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21850","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compact: Compositional atomic-to-complex visual capability tuning","venue":null,"work_id":"79b133bc-bcd1-4b43-8adf-272203f938d2","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2504.21850","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:cc71bf9c5ee424e3cec062f9a572e32c5791f938918f0f0d7bea880dfbb6cad3","observation_id":"8a9d4413-ca5d-4590-968c-e60a853897f6","resolution":{"observed_at":"2026-05-20T00:00:19.480510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14339","last_updated":"2024-08-26T15:08:12Z","snapshot_observed_at":"2026-08-04T00:37:34.749058Z","submitted_at":"2024-08-26T15:08:12Z","title":"ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty","version":1},"cited_work":{"arxiv_id":"2408.14339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.14339","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptmix: A com- positional image generation benchmark with controllable difficulty","venue":null,"work_id":"9b1c96b9-fc05-4169-8d7d-0fd246cfd2fd","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2408.14339","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:e839901fcadeb0666b78e6a3db6c7e4ef439ed62e328944f105ea1c98ca8348e","observation_id":"61dff8f3-c356-46eb-9b8e-a662c59e2651","resolution":{"observed_at":"2026-05-19T11:13:02.865956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":33,"verified_fuzzy":67},"total_outbound_references":158},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 158 outbound references and 1 inbound Pith citation observation for arXiv:2506.09082."}