{"as_of":"2026-08-17T15:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51a1e589a57af65480743bcd93414d531168c54d3ef0a15cdcae144ed2f1db49","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:03.367306Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T04:33:36.634359Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T21:41:16.983561Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"cited_work":{"arxiv_id":"2506.13888","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13888","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vl-genrm: Enhancing vision-language verification via vision experts and iterative training","venue":null,"work_id":"1629bdaf-6dd7-4172-b53a-ae37886ebce5","year":2025},"citing_paper":{"arxiv_id":"2604.24583","last_updated":"2026-04-27T15:08:02Z","snapshot_observed_at":"2026-08-16T13:43:25.715649Z","submitted_at":"2026-04-27T15:08:02Z","title":"Improving Vision-language Models with Perception-centric Process Reward Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:36.634359Z"},"links":{"cited_paper":"/paper/2506.13888","citing_paper":"/paper/2604.24583"},"observation_digest":"sha256:8d5f8f34663a6680b7b395ef74ddc0b5f63d0e39542b23420066b8a93ddc998d","observation_id":"f598c56b-c547-4a9b-887c-e6ea53c849e7","resolution":{"observed_at":"2026-05-11T21:41:16.993491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13888/citation-record","integrity":"/paper/2506.13888/integrity","json":"/paper/2506.13888/citation-record.json","paper":"/paper/2506.13888"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:33:53.663253Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:53.663253Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:c5b94228368cf0862dfaef79e71563f57703253540ba8ea5cc9f63a8528ba4bc","observation_id":"71f73914-ffcc-4ad3-bd6f-45c80ff82150","resolution":{"observed_at":"2026-08-07T00:33:53.663253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T00:33:53.903503Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:53.903503Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:2cdd1ea8f378de8f47439f75d6ae4b5b8f5f0cd84bfa494d81f62a889ff57072","observation_id":"5079a9e2-c7f8-4ffb-9c4a-243bfe007e95","resolution":{"observed_at":"2026-08-07T00:33:53.903503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-08-17T03:27:30.826224Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-07T00:33:54.034506Z","title":"Vlrewardbench: A challenging benchmark for vision-language generative reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.034506Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d8772b1568e320f72955b05265c3f35fa2835cebc734d572bc26f104007ea3da","observation_id":"cf97bcee-cb13-452b-a8e5-636f7213a605","resolution":{"observed_at":"2026-08-07T00:33:54.034506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.067987Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":"a2ecfed7-4ed7-465a-b89d-c13e2724cfea","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.154868Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:08c85fd2c51f921613005464488d37309c83653cd9739e518e214d3cbab990ec","observation_id":"81c9655d-a4f7-480e-9544-4e8fff1455be","resolution":{"observed_at":"2026-08-07T00:34:11.216046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.829571Z","title":"Silkie: Preference distillation for large visual language models, 2023","venue":null,"work_id":"e4bca2ba-0819-4823-9eec-4ea9cd1458fd","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.359009Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:b5cf3839c721069a50639f40fffa6a9ac3219ca2b4215dfe5eee42ab7717a22b","observation_id":"5e70e07a-1c5a-468c-b233-6d55cccb9a60","resolution":{"observed_at":"2026-08-07T00:34:10.902201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-14T21:12:00.450049Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T00:33:54.489101Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.489101Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:88a7b8727255590a48fb71192db9deb8bdd72a5a6b41a74838029c5273c0d352","observation_id":"92dc206b-2f27-4936-aa35-eeeed62849e3","resolution":{"observed_at":"2026-08-07T00:33:54.489101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:54.584748Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.584748Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:19e16504f22ef39097d1eed5aede2a331a4c25d4be42d297ddd727e09747bfae","observation_id":"6e16397a-fb4e-43db-90b2-7bc3c5970f64","resolution":{"observed_at":"2026-08-07T00:33:54.584748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.614290Z","title":"Strengthening multimodal large language model with bootstrapped preference optimization, 2024 a","venue":null,"work_id":"a9f9d40e-19c2-4c8d-bc31-1ac63e9849c2","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.714834Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:6731bf8121813aae841935e4dfb13afba2c4d729e1b9448e4e54031dd7606fb5","observation_id":"19d226a1-faaa-4712-8c19-de7c679ac146","resolution":{"observed_at":"2026-08-07T00:34:10.724456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:54.836665Z","title":"RLAIF-V : Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.836665Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:52c3edb60ae1381f788be1c368d1ce6b286dd0d2dc80205f8d45009274d2829b","observation_id":"92bb1aed-1ce9-4191-ac09-1bfdbc1d0dee","resolution":{"observed_at":"2026-08-07T00:33:54.836665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.413528Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"e1b0bb8f-7821-4c97-ad59-bd7ccf76e891","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.007073Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:988b74f756de8645941d5a8c1a6afb20b956157f145a89f0af72c6a20e590f2f","observation_id":"8407a231-d41b-4fa5-9edd-13a16d08b29b","resolution":{"observed_at":"2026-08-07T00:34:10.525501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.095026Z","title":"Self-rewarding language models","venue":null,"work_id":"459563f7-257a-4105-ae07-e510a592e060","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.131233Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:049a81c1333982498b44d521b763de8fcf8e0a0acbc3c6c21242afd27d09cba5","observation_id":"85f44ca7-2d2b-438f-8211-0fd8af44114f","resolution":{"observed_at":"2026-08-07T00:34:10.219552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.701147Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":"09663d80-e320-42b4-a260-d80aa08e6152","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.313774Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:96d56b096e3887ad5fce9e9edfd07c9735a81b9c516b6a87eb2b529c49bec8c3","observation_id":"897f665c-b0f7-4224-82fe-a734ff476882","resolution":{"observed_at":"2026-08-07T00:34:09.840092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-07T00:33:55.414768Z","title":"Rlaif vs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.414768Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:ded3a4364fd5ca7425b5dca468bd363c28f38a6e28e902b793a3d57b0d55fd57","observation_id":"43432bc8-86d9-40e3-8f00-ea415d2bb00c","resolution":{"observed_at":"2026-08-07T00:33:55.414768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.415368Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":"11354ce9-7005-438d-9943-402f0f31d030","year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.542063Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:558c552112640f6cfa658285866cc91142ad3b25344b7767d2487e38b782369f","observation_id":"aec22b80-3c18-4d55-b9d6-c941a1c09b7c","resolution":{"observed_at":"2026-08-07T00:34:09.535629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.044742Z","title":"RAFT : Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":"6685b33f-b852-4297-82f0-a64467960342","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.710576Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:482c6bcd6596ff3b41e513d71c1af1afc678cea01d5e0253419a8f2f7a92f73b","observation_id":"ea707d35-2e93-4723-aeed-3f9c65a8d884","resolution":{"observed_at":"2026-08-07T00:34:09.221417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.662687Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":"40618a68-872d-46b4-83b3-43936628a102","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.944239Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:82c9b4570960308eec490aafbf07d2040b02077a3f389d5dd24c7e8f169b06c4","observation_id":"9d3a3448-bd1f-4dd3-9b1f-e59ec1e1b857","resolution":{"observed_at":"2026-08-07T00:34:08.876205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-15T08:59:30.302596Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-07T00:33:56.124755Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.124755Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:a7418558b6f33220e109022cd1d0585d1568b5187c5c027f0057d19263ea595b","observation_id":"335a85c3-ee6c-4059-8461-65bf81add525","resolution":{"observed_at":"2026-08-07T00:33:56.124755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07502","last_updated":"2024-06-11T17:37:45Z","snapshot_observed_at":"2026-08-16T13:44:04.481701Z","submitted_at":"2024-06-11T17:37:45Z","title":"Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07502","snapshot_observed_at":"2026-08-07T00:33:56.251004Z","title":"Image textualization: An automatic framework for creating accurate and detailed image descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.251004Z"},"links":{"cited_paper":"/paper/2406.07502","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:edcf44166bf75b86730ca25002ddf10d0e95097cfbf36aff3cd232ef877bd95d","observation_id":"8ff8a13b-870f-4430-9788-4a5a244680df","resolution":{"observed_at":"2026-08-07T00:33:56.251004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-16T11:45:49.640236Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"cited_work":{"arxiv_id":"2502.09051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09051","snapshot_observed_at":"2026-08-07T00:34:04.453845Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","venue":"cs.CV","work_id":"f68d3fbc-385a-4f04-9db8-86f728895910","year":2025},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.525727Z"},"links":{"cited_paper":"/paper/2502.09051","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:3791206dea43052ac16ce1d8a19882b2383fedd0ae6a1a824fbdd0c4122d35a9","observation_id":"7d51a540-97a0-41d0-9202-02ef0d0b3ea4","resolution":{"observed_at":"2026-08-07T00:34:04.544547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-17T07:45:48.419891Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-07T00:33:56.665520Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.665520Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:e13443090b4f7a81bdfe75ff648d6a344267f3ef4c1f115987880bc0e14a3354","observation_id":"5f4fd0b5-7eee-4cc1-92ea-93643c245a82","resolution":{"observed_at":"2026-08-07T00:33:56.665520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-08-16T17:38:22.018669Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T00:33:56.770706Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.770706Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:29e3314af871e0762945793e83ad97685e29afae4b5c64b7487108c983c4a592","observation_id":"4dc8e471-1f47-4447-9f08-d0e01cf6afef","resolution":{"observed_at":"2026-08-07T00:33:56.770706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-08-16T13:42:51.381554Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-07T00:33:56.851632Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.851632Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:819674de91f96f0624fd91fe72e6b7d37efabcc04bd1c584b233c237288d5c18","observation_id":"17375a3c-39b5-4c5f-93b5-1113f5dbca4a","resolution":{"observed_at":"2026-08-07T00:33:56.851632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-16T14:28:08.540549Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-07T00:33:56.965198Z","title":"Secrets of rlhf in large language models part ii: Reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.965198Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:e98a0a6af4e672a6c3ff2ea92b9a00b1075b2c9af730b332d966349b3d4d8593","observation_id":"712e93bf-a4be-4b77-8f3b-32299be42706","resolution":{"observed_at":"2026-08-07T00:33:56.965198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T00:33:57.076467Z","title":"Aligning modalities in vision large language models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.076467Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:1c27a395294ff9b202a1f302720549fa012e6be3eb6fad5bfed9140503f418ae","observation_id":"97ee5a45-5a24-47aa-8ddd-27be7773c5e7","resolution":{"observed_at":"2026-08-07T00:33:57.076467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.401451Z","title":"Chi, Quoc V","venue":null,"work_id":"5a57e781-b988-416c-8710-35658d75965f","year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.145526Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d22d7604e348975dfa9924fe097904bd5d9eb2c48e24a6285033fdd2474c67ea","observation_id":"3af1a78a-4148-4762-8f6b-41e1dcaeab74","resolution":{"observed_at":"2026-08-07T00:34:08.485421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:57.337884Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.337884Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:2a145afaf62eb156bc12b25f89c9a046839bb3de4146725bb87fb8c7fe47c5d3","observation_id":"7300f65a-3223-421e-b689-8e8ecc2a5f18","resolution":{"observed_at":"2026-08-07T00:33:57.337884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.104735Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection, 2023 a","venue":null,"work_id":"f8eab864-7633-4d82-9b83-785a8eaaf562","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.515024Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:391cde696e24ce0d26c01c9c9e7ba9ba3716b059159419c060b3f3f3b29ee17b","observation_id":"c92ff6c1-a64a-4505-b622-bf0e88232d6a","resolution":{"observed_at":"2026-08-07T00:34:08.231425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:57.605814Z","title":"Detectron2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.605814Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:c3f08ac3c6468305a422a3fc6a9c6d13a11c10f71e9aa0369670a603a45b4c66","observation_id":"2fda5150-1f12-4cfd-a2f9-b595027bccb9","resolution":{"observed_at":"2026-08-07T00:33:57.605814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T00:33:57.696410Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.696410Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:845503a22c19f5a80704c6c9b473f23d8f3ceb518c3f837c19a2a5b22ffc11e7","observation_id":"057fb7c3-9c81-49c3-aff1-b0695aace441","resolution":{"observed_at":"2026-08-07T00:33:57.696410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:57.824861Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.824861Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:0584e0ece385775ee24f90fe60ce92d5ce6c7fd1ce56d0f3d6c6df402ee69ca1","observation_id":"9234ae8b-c117-484c-82ca-a7c707cd8634","resolution":{"observed_at":"2026-08-07T00:33:57.824861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T00:33:57.925619Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.925619Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:6ab5d80c0478d6e6453fb4273c89d85dbfd5b899847e55e92189da04162800c9","observation_id":"aeb1c785-afd8-4663-972e-468a808ab679","resolution":{"observed_at":"2026-08-07T00:33:57.925619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:58.089473Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.089473Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:9ab673355206f4291bcc8ec1f9c89e32017b70bcf86c51356b2d6d8c735fba07","observation_id":"16ab5fe5-b16c-4bf7-adaf-8a74df19abd2","resolution":{"observed_at":"2026-08-07T00:33:58.089473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T00:33:58.204744Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.204744Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:f7565a61211f1ac89c1f886cfecb9497d2848a4f484b115c301b3658a1e7f47b","observation_id":"3aea31ff-d467-4ea0-a473-3a36fc822df8","resolution":{"observed_at":"2026-08-07T00:33:58.204744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.711348Z","title":"Gemini: A family of highly capable multimodal models, 2023","venue":null,"work_id":"1d3db0f0-9b72-46aa-981e-4de307d3e457","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.323913Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:5a0ebf44c9e78563ee7190282480f84e23d7b35dbc2ca46b2811319205e33928","observation_id":"4f756b18-5c6c-41e2-a79a-6dc72c1eeef7","resolution":{"observed_at":"2026-08-07T00:34:07.881904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:58.494189Z","title":"Visual instruction tuning, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.494189Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:83faa99b9de2d99ea511784efe2c6788c8d41a30a5dfacbf9090288a0d8151cc","observation_id":"1d6f752f-6ec1-4570-a9c9-00d766f05db2","resolution":{"observed_at":"2026-08-07T00:33:58.494189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:58.598937Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.598937Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d499dcd1210fd707c6d8f57d94716c29568a189fbbd15b43c908a04d49dbe61c","observation_id":"c78671b4-f52e-4dc0-941e-2810b163f8bf","resolution":{"observed_at":"2026-08-07T00:33:58.598937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.420269Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding, 2024 b","venue":null,"work_id":"9252df0c-51e5-494a-9aa2-e7553435be93","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.678265Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:bd6d7840918058a27216a4ea13c8592aa310f766f4a7034e122795380d2288ff","observation_id":"eab265e1-d15b-4880-8499-3ffa908e199d","resolution":{"observed_at":"2026-08-07T00:34:07.546774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:58.820250Z","title":"Sharegpt4v: Improving large multi-modal models with better captions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.820250Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:1706494f3bf601081402a0b43fd1f60a7ed3f2fcaa8d1dcd9711ea1e7f780791","observation_id":"a0a66828-c668-484e-9de3-7be0787a80b6","resolution":{"observed_at":"2026-08-07T00:33:58.820250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:33:58.895296Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.895296Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:8c29457b0fec04656c87982188c4309d2043e33cb3ca76bc53fae2d94afa072c","observation_id":"5f8b388e-d3b8-47ef-b393-3048f178eb6d","resolution":{"observed_at":"2026-08-07T00:33:58.895296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.109451Z","title":"Fast r-cnn","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.109451Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:00f489371e5ca78a7379b3fbbad9076bf85de1519b2b935ab38b1457729135b9","observation_id":"17ff4a32-4028-4ef3-be13-82cf82910833","resolution":{"observed_at":"2026-08-07T00:33:59.109451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.032048Z","title":"G-detkd: towards general distillation framework for object detectors via contrastive and semantic-guided feature imitation","venue":null,"work_id":"8da302f0-23ae-47cc-83fc-35bf2e8c4b28","year":2021},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.257399Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:a05a414f930a1eab688b299f55251adb1269f40ecfdfbaf83b914561a3f0ada5","observation_id":"90a65f8b-979b-4f87-a34a-38dbe01c0037","resolution":{"observed_at":"2026-08-07T00:34:07.130882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.743868Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"806afe01-4473-4785-a419-06a15c143649","year":2020},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.466805Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:9536feeef9241c31eeea27ff0a215a90cc9df067195af721c1297911464e326b","observation_id":"659a3a35-0423-48d6-bed4-51a35d4dcdb4","resolution":{"observed_at":"2026-08-07T00:34:06.837984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.582006Z","title":"Global-local path networks for monocular depth estimation with vertical cutdepth, 2022","venue":null,"work_id":"03381351-3791-4ec9-a8ab-998743095d18","year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.614342Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:39371c3a0bea2bf8a0ed946de5c97e714d660845cc54fff289f298901addc528","observation_id":"06efcf38-7a97-4ae5-bb33-b0c38f04a6d6","resolution":{"observed_at":"2026-08-07T00:34:06.645786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.294533Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data, 2024 b","venue":null,"work_id":"9a1e5835-dfce-4f88-b96f-6452ddf61af9","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.733953Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:7b2911d17b7542c6b0d83c73fde6e273c4b740754b556700d71309a0e62591ad","observation_id":"32f16727-5973-4eb9-8a5b-ef19c1b28cf6","resolution":{"observed_at":"2026-08-07T00:34:06.408486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-07T00:33:59.917204Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.917204Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:8ccb16d792dbcedd3d5a3434a9c62256b74b32da546a3bd23d239e2ceb4082f0","observation_id":"703dd32b-d862-4d7e-af01-9adb8b00d82e","resolution":{"observed_at":"2026-08-07T00:33:59.917204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.930107Z","title":"Detclipv3: Towards versatile generative open-vocabulary object detection, 2024","venue":null,"work_id":"29f9da7d-7b10-47f4-894f-b202883f0889","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.069034Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:087c4f20bae4c8a58ec00154ef4187ed4aed2de624be7276515da7c1a78e1775","observation_id":"d1bed38f-3a46-46f3-bd26-4df047435b01","resolution":{"observed_at":"2026-08-07T00:34:06.072509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.209577Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.209577Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:aca388d9c0c6e43fa24bcdad7395c77f99925f0c20505b635411bf7099189a70","observation_id":"9b653fa4-3b63-43c8-aa2b-e9166cfb4795","resolution":{"observed_at":"2026-08-07T00:34:00.209577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.313903Z","title":"Entropy-regularized process reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.313903Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:4a95a0c743d6e8612a61b9f076b75c2a850e2d49e0d7423ab9d96187f997c8fb","observation_id":"1273b247-f85f-451a-b5ce-456753c43268","resolution":{"observed_at":"2026-08-07T00:34:00.313903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T00:34:00.459775Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.459775Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:3680d6f057d6b9d11be6d0d5e6a047bebfd74a5a7a3f7d6b018742943000b5b8","observation_id":"cfe08292-f8f5-4f7a-8ffb-56766c46e2ec","resolution":{"observed_at":"2026-08-07T00:34:00.459775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.538427Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.538427Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:c41829071f245fdcb20da043f0e7784f55e571077a9e34c95c3ba505ad119ba1","observation_id":"175b940e-df21-424b-bd9e-dc08f0673f5b","resolution":{"observed_at":"2026-08-07T00:34:00.538427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-16T13:12:52.288371Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T00:34:00.668832Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.668832Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:9c9c8b0bf4f721f2f5b7bc12d7c1e5922bd070a86438ae4975dc5459f42af4f6","observation_id":"e3a2a723-284e-4cfc-bbcb-7508e1d319c5","resolution":{"observed_at":"2026-08-07T00:34:00.668832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-16T14:31:20.852372Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-07T00:34:00.772326Z","title":"Some things are more cringe than others: Iterative preference optimization with the pairwise cringe loss","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.772326Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:323fddf68c6fdc67dd6051824f2ee02f3bff008101600a56b2b7bb76561adeac","observation_id":"41150ab9-a1a5-455d-a39a-e2ed661c1a3d","resolution":{"observed_at":"2026-08-07T00:34:00.772326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.597299Z","title":"Reinforced self-training (rest) for language modeling","venue":null,"work_id":"70be157f-c55a-4d41-b220-83fe86721c11","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.898171Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:e93e80bb0011752d802c00ff30f77b9d4dc0ae530eada241d2c59d0a752ea23c","observation_id":"46d38e64-5e7f-4d8f-996f-544aef9cdf00","resolution":{"observed_at":"2026-08-07T00:34:05.689725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.354808Z","title":"Self-play fine-tuning converts weak language models to strong language models, 2024 b","venue":null,"work_id":"58e9cb10-b97c-44ca-b9e9-8feaea5c6393","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.997086Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:b031b360c0d5ee0e9bf0cf0eb3483f4a4a24ae6268416f1a8deccfaa7952acc7","observation_id":"0f6a21d9-2b56-4249-b0d4-f50e735f049f","resolution":{"observed_at":"2026-08-07T00:34:05.457636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.254752Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.254752Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:dd1fae61ffdbc4246e1a72e251ba5db47afdbed7ca8374041cf5d5735dc51496","observation_id":"7b990001-6d13-4f8f-91b7-b7665f47f180","resolution":{"observed_at":"2026-08-07T00:34:01.254752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11069","last_updated":"2024-06-16T20:53:25Z","snapshot_observed_at":"2026-08-16T13:42:29.466840Z","submitted_at":"2024-06-16T20:53:25Z","title":"WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11069","snapshot_observed_at":"2026-08-07T00:34:01.366014Z","title":"Wildvision: Evaluating vision-language models in the wild with human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.366014Z"},"links":{"cited_paper":"/paper/2406.11069","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:9b6157f76d00ec1704f0c07836ce04dce3c4c7a9da7ae2db70b1975f105b6eea","observation_id":"4cf8f6cb-6683-4aa0-95ff-b22f40faa089","resolution":{"observed_at":"2026-08-07T00:34:01.366014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.056399Z","title":"RlHF-V : Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"8abbadf0-5414-4c1f-810f-5cfcc4130019","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.535272Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:a74699018b6f26bcfe5ae3c30ead9c9ded840aa5fd7b70db8adbb8e36210fb92","observation_id":"9f24e489-e291-46e5-b7ad-b4a4f303a15c","resolution":{"observed_at":"2026-08-07T00:34:05.131722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T00:34:01.674745Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.674745Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:8f86127e2c32420fb5046e68798c835a040235ec86490c27cfadf07f20d1c48c","observation_id":"68bb5824-4ba9-4039-b49d-1727dc6a549e","resolution":{"observed_at":"2026-08-07T00:34:01.674745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.864042Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169--186","venue":null,"work_id":"5655cd2f-631e-4906-bf2d-903143d8893b","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.784926Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:a5f8457f88f1fd71dfe1337fb2d253b03aebbc68187076e49624185ce6a52de6","observation_id":"a725c543-89c3-4ae7-8a4a-e3e1d6d57199","resolution":{"observed_at":"2026-08-07T00:34:04.935766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05318","last_updated":"2024-10-05T05:21:48Z","snapshot_observed_at":"2026-08-16T13:12:22.849830Z","submitted_at":"2024-10-05T05:21:48Z","title":"Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05318","snapshot_observed_at":"2026-08-07T00:34:01.910015Z","title":"Improving llm reasoning through scaling inference computation with collaborative verification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.910015Z"},"links":{"cited_paper":"/paper/2410.05318","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:f54aca5bd2088c427f6852f864296736d1bc0a0d8ea324aed38bc83a6a401341","observation_id":"497b1613-5f52-448f-88a8-1645b6bba42e","resolution":{"observed_at":"2026-08-07T00:34:01.910015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-08-16T14:19:52.313301Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-07T00:34:01.982398Z","title":"V-star: Training verifiers for self-taught reasoners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.982398Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:3731f94f6e17df257c20bd91a0d602cfb3dbefaebe8ba15e4ab7cbb7ef852dc0","observation_id":"10b8cb74-dedb-4513-bbb4-17d9cd73fdbb","resolution":{"observed_at":"2026-08-07T00:34:01.982398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:34:02.117511Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.117511Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:4ebc9f9aa5a566e84119f5dce2555b5af1e23e369bf0baa53683b33048371b61","observation_id":"964dcb89-b750-40de-87cb-9f150da3de60","resolution":{"observed_at":"2026-08-07T00:34:02.117511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T00:34:02.276771Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.276771Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:cfb28720caae5ebffa9070da13d6a7bb4decd8eafb4cba6ca835057a2ab630b6","observation_id":"baff011b-f8e4-49ec-ae43-3ddf46008b7a","resolution":{"observed_at":"2026-08-07T00:34:02.276771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.392041Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.392041Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:29079b93f08baf4d5223ce1f7d4a7bd54fe799d176e5864fcaf2d21f9c831dd1","observation_id":"54846322-0400-41c2-bddf-a584ee6cdc9c","resolution":{"observed_at":"2026-08-07T00:34:02.392041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.549287Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.549287Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:361651ec431aaaff0b4b01f175da162eddde8e85d5b4fff4baf588cc15d0c048","observation_id":"c4f294e2-d043-4c98-983d-e5fd7e3cea53","resolution":{"observed_at":"2026-08-07T00:34:02.549287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:34:02.661492Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.661492Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:81574e93072965eaecc86b2a01873a97fa2eecbb5cacba99b8544cdd9cc99e78","observation_id":"a18b81a1-3763-4337-ae71-4ba9b7ef5f7e","resolution":{"observed_at":"2026-08-07T00:34:02.661492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T00:34:02.816427Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.816427Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:b3659b34957521acdc0510e42dddbfed1b595883442409812cc4f5890292ed17","observation_id":"ced36032-cf5c-4953-9d69-a793bc53113a","resolution":{"observed_at":"2026-08-07T00:34:02.816427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T00:34:02.960724Z","title":"Deepseek-vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.960724Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:09aa68af597154cc25c05eae72565009b8a82fbd860abe86df730cf8f4985a45","observation_id":"210b0553-5bec-4d76-9353-5a32a79b2165","resolution":{"observed_at":"2026-08-07T00:34:02.960724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-16T13:11:31.171443Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T00:34:03.076564Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.076564Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:334945c276e0e620e020d67e726e80303f4c3aa77aded7a9844ec75a1560256e","observation_id":"d45607f7-0eeb-4f4a-9271-0dce9d0007ae","resolution":{"observed_at":"2026-08-07T00:34:03.076564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T00:34:03.216795Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.216795Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:4a0e589b05c482c33e038e942f7f0691e92e2fddbcce527f5d35007f8a8e2812","observation_id":"456f258d-cdda-45e3-a431-c54fb8de5b8a","resolution":{"observed_at":"2026-08-07T00:34:03.216795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:34:03.367306Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.367306Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:f5a8ae1ac263537a0bf2e01162a9e576eadca17e245e9c1cd4b093e7792b61bd","observation_id":"5876a8e5-1de7-487e-a2b7-ebbc8f195b8b","resolution":{"observed_at":"2026-08-07T00:34:03.367306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 1 inbound Pith citation observation for arXiv:2506.13888."}