{"as_of":"2026-08-14T18:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c483915b39aa1d596f1ce6b6b4b0f58af12c761aeda018dc57e09a49785a9eb","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:34:35.594979Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:41:58.673348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T22:35:51.417589Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"cited_work":{"arxiv_id":"2501.04568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feedback- Driven Vision-Language Alignment with Minimal Human Supervision","venue":null,"work_id":"6f295088-67b2-4f6a-a52b-80b54cb79ed8","year":2025},"citing_paper":{"arxiv_id":"2604.05614","last_updated":"2026-04-07T09:03:12Z","snapshot_observed_at":"2026-08-11T12:47:51.577381Z","submitted_at":"2026-04-07T09:03:12Z","title":"Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T19:41:58.673348Z"},"links":{"cited_paper":"/paper/2501.04568","citing_paper":"/paper/2604.05614"},"observation_digest":"sha256:6ccfadb6b9f7d4443494253a72a6c9dfcefd7cd2e2ba68a0f1556d1a1d89c20c","observation_id":"e39f026f-64ca-46ac-9e31-8b1b235e05e1","resolution":{"observed_at":"2026-05-10T22:35:51.423869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.04568/citation-record","integrity":"/paper/2501.04568/integrity","json":"/paper/2501.04568/citation-record.json","paper":"/paper/2501.04568"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T21:34:34.931476Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.931476Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:033dccfa75f739831e301d31505a31dd1d11e5f94e140d70f6d0fefa5f37c57d","observation_id":"878090a4-d779-44d2-b6f8-1d0a6d23754b","resolution":{"observed_at":"2026-08-10T21:34:34.931476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.937048Z","title":"Agrawal, K","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.937048Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:15cd981e965e069b28f35505ebfdcf882f9f3efdf4a915fc8a9283c0f0e5192e","observation_id":"32d9879f-8e91-4db7-90ee-899051b96cc1","resolution":{"observed_at":"2026-08-10T21:34:34.937048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-10T21:34:34.941481Z","title":"Ahmadian, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.941481Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e60240e528fe216dda6565e68214efbd8ff75521f823464385a82f057c60157e","observation_id":"3694a681-b2d0-4114-8ced-70895428e77c","resolution":{"observed_at":"2026-08-10T21:34:34.941481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-08-07T19:33:04.292595Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-10T21:34:34.947407Z","title":"Akyürek, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.947407Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:d40b4ecc863fac562475b475350c004a90380710c775b2ab5c114682b6429d39","observation_id":"4ffd809b-61fd-4843-96ab-870d088a292e","resolution":{"observed_at":"2026-08-10T21:34:34.947407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.953338Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.953338Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:204301bcaed70a9facc90b9ae7cad4e79afdf664609b7bc5d381afa8e1444bd2","observation_id":"7474ee78-909d-4701-9a8f-384dc7bab561","resolution":{"observed_at":"2026-08-10T21:34:34.953338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.958760Z","title":"Anthony, Z","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.958760Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:14c3f7cd0f576c3ef3889d27df0037a1834b674fe8153e237c1fe7087c988e30","observation_id":"71d04822-d2d4-4bc0-9c9a-8ad64dc95e1a","resolution":{"observed_at":"2026-08-10T21:34:34.958760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-10T21:34:34.964208Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.964208Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:dfd8b3bbd5f33c9f1c09606992a5d38fac3922b4e22e29266dddfc092d53f13b","observation_id":"cdab2c24-dd18-40d9-89c0-c0f18369e1fe","resolution":{"observed_at":"2026-08-10T21:34:34.964208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-10T21:34:34.973845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.973845Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:5d7820a036cc44ec176738800f4c3797a3109e5cc59f1eb4bb2413a78e7466ab","observation_id":"e6885b9d-e499-418e-8676-15396940c355","resolution":{"observed_at":"2026-08-10T21:34:34.973845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.978603Z","title":"Banerjee and A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.978603Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:c151fdcf435bbaef83f6e68af5b0fa2fe840fa590e61a1ba775c92f5d7b7e4e7","observation_id":"eb961fdf-bffd-453e-9911-eaa1254e266c","resolution":{"observed_at":"2026-08-10T21:34:34.978603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.982785Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.982785Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:4233561dff582a3f039c3603e8bcaf198c44b07f7fd6fc721a0bea59f523d1a7","observation_id":"34624016-5e5f-4eb1-980f-e0ba1c339fe0","resolution":{"observed_at":"2026-08-10T21:34:34.982785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-10T21:34:34.987003Z","title":"Beyer, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.987003Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:198f39afda65a8f9751b7fcd99010bc09d847a96433f627514ee155d25c66a32","observation_id":"a2d0aaeb-d4cd-4ca1-8fbe-5d464f3bd4b3","resolution":{"observed_at":"2026-08-10T21:34:34.987003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-12T23:57:02.109382Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-10T21:34:34.991443Z","title":"Bordes, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.991443Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:70dd6802f0a13ea5a56d2af752d7f1025c7389f7341ccc010b4eb2765cc74719","observation_id":"9d087100-76dd-4a0e-950f-c2b6f169a9fd","resolution":{"observed_at":"2026-08-10T21:34:34.991443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.995902Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.995902Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e2f9d0fab4a8aa8bffb5c73feb4fab8bdcf3a92abe0ec22970a186e177bb3827","observation_id":"c495a7b7-1008-4907-8641-d6b95aabe1bc","resolution":{"observed_at":"2026-08-10T21:34:34.995902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.000515Z","title":"Carion, F","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.000515Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:b125c42d364b80f5d73a31f1b10f353a2d30dd7d88ce1827560a3ec1dd0b797a","observation_id":"5bf2d01e-dbba-43ac-9d0e-333859fa2f8a","resolution":{"observed_at":"2026-08-10T21:34:35.000515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-10T21:34:35.004387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.004387Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:eb43affb24a53dde65f683fc76cf867ffbe1394501318e22c390a16364214407","observation_id":"b5c61565-a26f-4a92-9daf-179399d0330c","resolution":{"observed_at":"2026-08-10T21:34:35.004387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.008817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.008817Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:400447abb7b8461d7733f5dffcafb2183d191d063fd1a54bf27e1613d6485ca0","observation_id":"89342bce-3e91-4aac-bf88-d82c344e4c1a","resolution":{"observed_at":"2026-08-10T21:34:35.008817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.013082Z","title":"Chiang, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.013082Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:094c10d6ac144635bc5d06d3fc73eac165cf22871ed336839870b4e686739573","observation_id":"850fcc1d-5643-4686-9f1d-0fddf665bf05","resolution":{"observed_at":"2026-08-10T21:34:35.013082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.017220Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.017220Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:8d090e38fe83694dcf2a3ca818d00e4c485015be4e1900b49ae09f28a0b0f343","observation_id":"2046ea3d-8e12-45da-97ec-a0f27ca6eb92","resolution":{"observed_at":"2026-08-10T21:34:35.017220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.021685Z","title":"Collerton, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.021685Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:36d2e1db873223f3a197c4b81290d6ca9bf3ca9ad81c05b269292d30efa9a9f9","observation_id":"fc4d0547-f5f6-462a-a702-3fa95d0eca58","resolution":{"observed_at":"2026-08-10T21:34:35.021685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.025848Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.025848Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:6b5b3b6790f41b85c3da8b5a654ae2c256a63c2238df094db95821ff740766d9","observation_id":"56f71cab-a7d4-463f-8650-3f89730ac78a","resolution":{"observed_at":"2026-08-10T21:34:35.025848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01066","last_updated":"2022-03-15T06:04:05Z","snapshot_observed_at":"2026-08-10T23:04:40.688955Z","submitted_at":"2021-02-01T18:56:02Z","title":"Evaluating Large-Vocabulary Object Detectors: The Devil is in the Details","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01066","snapshot_observed_at":"2026-08-10T21:34:35.030102Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.030102Z"},"links":{"cited_paper":"/paper/2102.01066","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:8513d3198106cc2c406fae337ccd46416d637e9f4689aaa6543efc7a9298a81b","observation_id":"9adc9177-a2b2-424f-8f65-f755a66aa877","resolution":{"observed_at":"2026-08-10T21:34:35.030102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-10T21:34:35.034916Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.034916Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:da578bb70d25d6adbdb2c10baa93dc8949b232698d58829576e753252d3e28cc","observation_id":"a2f69265-b911-483d-a4de-259bd3085b10","resolution":{"observed_at":"2026-08-10T21:34:35.034916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T21:34:35.039873Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.039873Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:84f500572a88e7d42171e9b616f3e14f3d0e2c566b4e2ce1df4d0eddbabf5d47","observation_id":"db55ea79-7b36-47a2-b88d-100efad54b0a","resolution":{"observed_at":"2026-08-10T21:34:35.039873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.044221Z","title":"Favero, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.044221Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:01a8a5721ee13a3921c4a8818ef0b86e5b349c4de49ad37fc73c6ca8a707e8ab","observation_id":"a2c326b4-a744-4bb0-bdc7-95995fa1fafa","resolution":{"observed_at":"2026-08-10T21:34:35.044221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.048986Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.048986Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:9df6f0324780fb5fc3ca8dd6754c87baac5835dfb19a5f4d5d50880642e2367d","observation_id":"5052f0c0-c76e-46bb-bea3-dac339e76a4f","resolution":{"observed_at":"2026-08-10T21:34:35.048986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.053903Z","title":"Girshick, J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.053903Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e649753962691e1acd17befcf17d18651f7f306e98baaf57442b4ffa23465b1d","observation_id":"5cae555b-9c03-4fa3-ae0f-af6141fd5145","resolution":{"observed_at":"2026-08-10T21:34:35.053903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.058226Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.058226Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:843622f7bed82faf44aa56a7522622850ba0e3bb962349862a999b7116a65389","observation_id":"b32a54f5-af38-41f5-a890-2daa442ea00c","resolution":{"observed_at":"2026-08-10T21:34:35.058226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08215","last_updated":"2023-06-06T13:09:21Z","snapshot_observed_at":"2026-08-13T12:43:30.056515Z","submitted_at":"2023-02-16T10:59:39Z","title":"Aligning Language Models with Preferences through f-divergence Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08215","snapshot_observed_at":"2026-08-10T21:34:35.062540Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.062540Z"},"links":{"cited_paper":"/paper/2302.08215","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:59cc6a0f9dd5edc886823dceb607954fce2428e0359f01321b5ae8f920fd6656","observation_id":"698ca582-b5e9-483e-950e-fd79b10bf7c0","resolution":{"observed_at":"2026-08-10T21:34:35.062540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-10T21:34:35.067108Z","title":"Gulcehre, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.067108Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e4381e963293dc3ff5938a71d1834b2152aa357038edfa4c5609f761d1b97fe4","observation_id":"f577cb62-6a42-4cc3-a61f-f0f2f6702c37","resolution":{"observed_at":"2026-08-10T21:34:35.067108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.071728Z","title":"Gupta, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.071728Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:18813fe43143d5277557de8d51eaaf3f08b49b9cd0034d26b369ad781234f75a","observation_id":"68106966-7b72-4cba-a9b4-f035876b65f1","resolution":{"observed_at":"2026-08-10T21:34:35.071728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.075865Z","title":"Hattie and H","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.075865Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:7aeed28d7699e2073956c5cf63aad63c4ca7ababcf05af5dea0c96745fc64e36","observation_id":"2eca5a40-89a6-41a3-854f-d06155598b7b","resolution":{"observed_at":"2026-08-10T21:34:35.075865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03264","last_updated":"2024-04-04T07:39:55Z","snapshot_observed_at":"2026-08-13T18:24:19.034746Z","submitted_at":"2024-04-04T07:39:55Z","title":"Foundation Model for Advancing Healthcare: Challenges, Opportunities, and Future Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03264","snapshot_observed_at":"2026-08-10T21:34:35.080759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.080759Z"},"links":{"cited_paper":"/paper/2404.03264","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:6b5d1db2430354dbafbbf453669c300c6f464aac2eeb0cb0b070df84367f5739","observation_id":"1e843c24-4400-42a9-8c2d-29f2ad650c82","resolution":{"observed_at":"2026-08-10T21:34:35.080759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.085552Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.085552Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e398c971546b026b1473b1d0ca5e4c2197ac8f15275f679035b5302255be896a","observation_id":"3b03dd56-acf9-45ee-a62e-ba5f1eb5c64b","resolution":{"observed_at":"2026-08-10T21:34:35.085552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05439","last_updated":"2020-11-07T20:22:57Z","snapshot_observed_at":"2026-08-07T17:16:52.918771Z","submitted_at":"2020-04-11T16:34:24Z","title":"Meta-Learning in Neural Networks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05439","snapshot_observed_at":"2026-08-10T21:34:35.090793Z","title":"Hospedales, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.090793Z"},"links":{"cited_paper":"/paper/2004.05439","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:a611cf388921e4f698919e65ddae3a84061a78b97bde0da80d3180b853b59a27","observation_id":"b6fd9dc4-654f-4009-9412-cb8348171412","resolution":{"observed_at":"2026-08-10T21:34:35.090793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T21:34:35.095790Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.095790Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:932d68c5bdb13d945371f17a4f5d9d8b55eb884417b757054288d473d7f72615","observation_id":"8cb71eeb-2f44-4129-8371-3e4fec8a6962","resolution":{"observed_at":"2026-08-10T21:34:35.095790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.100708Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.100708Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:0ab4e49bd65d378986eb6669a247a27cc38ffd18343bc631e342c62aff99e953","observation_id":"86a9a661-7f35-4a24-97f5-3305cf2a3f51","resolution":{"observed_at":"2026-08-10T21:34:35.100708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T21:34:35.104820Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.104820Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:070dacd9d691247384c875971f9d8f2f5a5b7c50016738bd2a10da4c75143e8f","observation_id":"23b50291-d88b-466a-8124-7a0bce5b3ec8","resolution":{"observed_at":"2026-08-10T21:34:35.104820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.109247Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.109247Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:99a9ea54b9dfc0967ddd471e6263224b9b9b06db4f8b0fad3f5a99c30b0cb77f","observation_id":"037b3905-0924-4610-a01c-dcac07746564","resolution":{"observed_at":"2026-08-10T21:34:35.109247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12034","last_updated":"2024-10-07T14:27:56Z","snapshot_observed_at":"2026-08-12T23:40:40.726327Z","submitted_at":"2024-06-17T19:06:54Z","title":"Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12034","snapshot_observed_at":"2026-08-10T21:34:35.113712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.113712Z"},"links":{"cited_paper":"/paper/2406.12034","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:3cd7e4af9fc3dc2890e4037692fe53c947711892f48a4f94f6c9860ee5dd4038","observation_id":"610cf59a-1b5b-4248-8419-0feacd8cdb6a","resolution":{"observed_at":"2026-08-10T21:34:35.113712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.118025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.118025Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:86e6d11086ddba9f34f6a404b4f3fab951177e11c8539519cd62b0bad94907bc","observation_id":"2f54bac0-1e87-4bd7-88f0-3e37e75f886f","resolution":{"observed_at":"2026-08-10T21:34:35.118025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.122652Z","title":"Kazemzadeh, V","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.122652Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:c81d4ee096312c2b09218fea7d251c1545ffb25ed43d5f132c371c9c307305b0","observation_id":"9eb64d4d-e5bd-4d12-8e1d-ca38b30f3a2e","resolution":{"observed_at":"2026-08-10T21:34:35.122652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.126990Z","title":"Kiefer and L","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.126990Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:4b1cc2d288508d867b84eb9b07ca80253f965069562edb0e07b29570cf24d452","observation_id":"3b02740c-0921-4a76-9d19-b0fcbcad3f8d","resolution":{"observed_at":"2026-08-10T21:34:35.126990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.131178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.131178Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:a7171d42adbc197ef1647462535bac6792571d1693a0119e6823d1ed584c6e25","observation_id":"d327302b-3b75-4d4d-8caa-a6c84789e86c","resolution":{"observed_at":"2026-08-10T21:34:35.131178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.135371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.135371Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:312228266c6971eab19cd22ce8c4c1550bd7bdb1381962b46de396b675978e58","observation_id":"1b8325a1-a876-4e4a-96ef-2575662909ff","resolution":{"observed_at":"2026-08-10T21:34:35.135371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:34:35.139694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.139694Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:17b7b3271b5a38aae75bbc6cb906a6e8c05ce10d3f82293a7290a2e58ed3baa9","observation_id":"ee277cb2-d287-40fa-b6ce-2d5dba39fffc","resolution":{"observed_at":"2026-08-10T21:34:35.139694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.144811Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.144811Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:b6b48f9f8feecbcbeb955f01059e692630747ff5b18995edd493559c63eacadd","observation_id":"cb2fafe6-72c7-4b7b-8f58-a838f84a00eb","resolution":{"observed_at":"2026-08-10T21:34:35.144811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.149220Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.149220Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:dfdc845e26c88664ae872f99273e3a07805db936ff17e8720f924b311e11ffab","observation_id":"bc133f54-8fdc-4192-8e62-de5ed743dd83","resolution":{"observed_at":"2026-08-10T21:34:35.149220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.153357Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.153357Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:3319bc84692dbcf73cb2196fcc0c9c6526e93142f7eab83c8696e22bdf176e6d","observation_id":"5631aa0a-b0c0-4041-b00e-ce2faefa1066","resolution":{"observed_at":"2026-08-10T21:34:35.153357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-10T21:34:35.159313Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.159313Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:bbe380d4fce1f0713ba8d4ed0e305b5d7a493f7f1061ce04bcdcbd8e52321ff9","observation_id":"78737c36-eb42-4e24-9a99-722fe21f42f0","resolution":{"observed_at":"2026-08-10T21:34:35.159313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.09835","last_updated":"2017-09-28T15:59:41Z","snapshot_observed_at":"2026-07-06T05:53:24.061473Z","submitted_at":"2017-07-31T13:08:11Z","title":"Meta-SGD: Learning to Learn Quickly for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.09835","snapshot_observed_at":"2026-08-10T21:34:35.164496Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.164496Z"},"links":{"cited_paper":"/paper/1707.09835","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:2d446e635fd48a73fcc2ec0970b24c12b20debb5d597f83c5221860e36bacc8a","observation_id":"5ba40cf8-7280-4d1b-a358-e40855b3a362","resolution":{"observed_at":"2026-08-10T21:34:35.164496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.169519Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.169519Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:371d32902a24c86bc222f08b3e183f971a76577bc23127f91bb5062f9a60e025","observation_id":"867056cb-d36c-432d-a46a-5e5117686c13","resolution":{"observed_at":"2026-08-10T21:34:35.169519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.174740Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.174740Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:737d997b5ae73f3e8db68acb1cc3677864052efd2839ad6e3dbfa2cc48b2e877","observation_id":"39b8c9e1-c9b8-4868-a147-d4d1fd770d66","resolution":{"observed_at":"2026-08-10T21:34:35.174740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.178963Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.178963Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:8ffa2e40f07f5a8cdbe80a40366d956a5b7191d9846be7c2ce59f9c77fbb0f26","observation_id":"17b11415-edfa-4406-9077-25d3f6030d6a","resolution":{"observed_at":"2026-08-10T21:34:35.178963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.183587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.183587Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:d0d0a8da8d1db22272e1d0dc99bccf9336ac6f593d058636cd41eab873ebb3be","observation_id":"0c16ae80-772e-4bc9-ac9e-e8efef9a8723","resolution":{"observed_at":"2026-08-10T21:34:35.183587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.189707Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.189707Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:031860a901761582cabfd16ad986d7633e0cc32f3f3b475ec65b60c89b33def7","observation_id":"b45e967d-0689-43c1-951d-b377fa5b91ba","resolution":{"observed_at":"2026-08-10T21:34:35.189707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.195100Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.195100Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:83fc691c0b44c756a0aead7193d39f9289a3e709e7ff18a2a14208f1f5ae2ddf","observation_id":"ea07be76-999d-477b-8c8a-fc21358cd12d","resolution":{"observed_at":"2026-08-10T21:34:35.195100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T21:34:35.372992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.372992Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:1d771bd7e37af22a5ab28be3ebde3dcb71807aeedb7512c74f432e1a9d38bd42","observation_id":"61207065-261c-4e15-85d2-d48cc2b14958","resolution":{"observed_at":"2026-08-10T21:34:35.372992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.378684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.378684Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:2c4de6279e3408b7e7234375a76455bb3113357f405f78c8480e5348430dc391","observation_id":"845a080a-1088-4a7c-b38e-b51a555704dc","resolution":{"observed_at":"2026-08-10T21:34:35.378684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.383422Z","title":"Madaan, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.383422Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:49a1d0061e51f9875062b16fa308c103874f37c9e0c8bd91c01d7010bb4e8c92","observation_id":"91a31114-c52b-481b-9360-3f8f2a83cffa","resolution":{"observed_at":"2026-08-10T21:34:35.383422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.388417Z","title":"Oquab, L","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.388417Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:438f42ea6abd16454687e725af40ec764fa330711993eca2ffed6f27c2da7be9","observation_id":"d3da44bd-ce66-4737-8f13-cb77737f3385","resolution":{"observed_at":"2026-08-10T21:34:35.388417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-10T21:34:35.393161Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.393161Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:61077e92e74afeb62edf305944ed3039f84d9f1d6ad543c0252b0f07daac7f41","observation_id":"83b172f2-c784-43df-af09-ab8179ac6f8e","resolution":{"observed_at":"2026-08-10T21:34:35.393161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.398610Z","title":"Papineni, S","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.398610Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:f4c8bc4c5858d6a8ac8e9a45575c06f06330853719b903ad61c17928b33dd978","observation_id":"f129c070-7340-42e9-9204-5b344f73b326","resolution":{"observed_at":"2026-08-10T21:34:35.398610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:37.021103Z","title":null,"venue":null,"work_id":"766776e4-293f-4d29-93e4-37941f3ccf5a","year":2015},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.404501Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e671df21051e2c2e38e61ebf8875cbae79d28e2d97e9f9230f320d476795f50f","observation_id":"46d47fc1-be05-47af-b5c2-de0f89acb80e","resolution":{"observed_at":"2026-08-10T21:34:37.027583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-10T21:34:35.410160Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.410160Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:90988e3195341ed429cdc9c8bd760249aef91f5309c6f1b0b8e217d3da6ff910","observation_id":"61e5d573-b8a4-4fba-b07a-c8bb7e0464d1","resolution":{"observed_at":"2026-08-10T21:34:35.410160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:37.003019Z","title":null,"venue":null,"work_id":"ae83c669-3d2b-4112-950a-856893208770","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.417009Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:390baf6e858b34cf2331f71cc02875a65a94551e15c5b0885c77f84425141f50","observation_id":"57d8e92c-08d4-493a-aade-2acd2b7ec86e","resolution":{"observed_at":"2026-08-10T21:34:37.008257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.421983Z","title":"Peters and S","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.421983Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:55b43e99c4d41ddf46a89acf5813514e3c71d443468d8a0d6662a02274e67707","observation_id":"0f4293f2-33f2-494f-9a2c-110b6374ac53","resolution":{"observed_at":"2026-08-10T21:34:35.421983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12668","last_updated":"2024-12-09T18:54:36Z","snapshot_observed_at":"2026-08-13T05:20:21.392565Z","submitted_at":"2023-11-21T15:20:48Z","title":"From Concept to Manufacturing: Evaluating Vision-Language Models for Engineering Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12668","snapshot_observed_at":"2026-08-10T21:34:35.427447Z","title":"Picard, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.427447Z"},"links":{"cited_paper":"/paper/2311.12668","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:4d72d5f31f6f644c51f01b11e8e52f298fbc87337f9dc47edb8029fdf705a734","observation_id":"f11008db-3ecd-42dc-b569-bac88f915e96","resolution":{"observed_at":"2026-08-10T21:34:35.427447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.435022Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.435022Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:f08aea21b6182562b6643590019588d71bc1e2dc56338f4f4454385bfe029e08","observation_id":"9fe61691-2c1a-4d29-99a5-9929d98c2684","resolution":{"observed_at":"2026-08-10T21:34:35.435022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.440302Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.440302Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:7582390fa384cbaf01344ce2d36d63404ac634b9dc4ef9901e52de39e7d9a474","observation_id":"a41a9d37-9ca0-461b-9249-475131ffde94","resolution":{"observed_at":"2026-08-10T21:34:35.440302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.952100Z","title":"Rafailov, A","venue":null,"work_id":"77316bc5-7e25-41b6-a7ed-03d194acb489","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.445372Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:7b257016c559c072fabe49f22f49a240efe04c431aac040b4e9b209ea0e02994","observation_id":"be003b50-e0a8-4d17-8689-fcba51ad3b71","resolution":{"observed_at":"2026-08-10T21:34:36.956900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-12T23:26:08.853045Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-10T21:34:35.450573Z","title":"Rahmanzadehgervi, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.450573Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:1a88ce52d38810be318c10b3eab13f15e40b302158ebda9e45b4e9184fc4f7bb","observation_id":"1ab5e6f0-e331-4e55-beb0-0b0d50c531e6","resolution":{"observed_at":"2026-08-10T21:34:35.450573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.935791Z","title":null,"venue":null,"work_id":"6f59a38a-6d9a-4c6c-8b09-912e888636b2","year":2016},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.455262Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:eaa683c7aab58dab26e9df5282445b9468ccbc98a456a3baaca6637575cc3adb","observation_id":"126f1b1d-4ab7-4e86-8581-e6c2e14c3c57","resolution":{"observed_at":"2026-08-10T21:34:36.940756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-07T16:54:46.428327Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-10T21:34:35.460399Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.460399Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:b02b1f472d7a252cd37445ad1143de10a33ff4d8f6050c6a153a4b4161981401","observation_id":"e5621796-6727-4ed6-b694-2dfa5474df98","resolution":{"observed_at":"2026-08-10T21:34:35.460399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.919265Z","title":"Saikh, T","venue":null,"work_id":"37118b2b-59e9-4ab6-a3d9-50d7ebd08002","year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.465293Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:88f043a909d830676ef1d5a04eef3c2cbafec61cada195fa0744b2af0bd82deb","observation_id":"10f49899-a4d2-4c1b-a778-eec86572a4d2","resolution":{"observed_at":"2026-08-10T21:34:36.925038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13146","last_updated":"2025-03-30T01:59:15Z","snapshot_observed_at":"2026-08-12T22:21:22.794487Z","submitted_at":"2024-10-17T02:03:27Z","title":"debiaSAE: Benchmarking and Mitigating Vision-Language Model Bias","version":2},"cited_work":{"arxiv_id":"2410.13146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13146","snapshot_observed_at":"2026-08-10T21:34:36.155671Z","title":"debiaSAE: Benchmarking and Mitigating Vision-Language Model Bias","venue":"cs.CL","work_id":"3d5aa939-807a-4bad-87b8-1b3f67816282","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.469776Z"},"links":{"cited_paper":"/paper/2410.13146","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:f9e3111438f8b8d7a67f485f2ac60d037eb65a1d570b5cc05b1386548a09e4d7","observation_id":"c953b626-e876-4aa4-940e-8fb7a6d1ba7a","resolution":{"observed_at":"2026-08-10T21:34:36.163169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.901105Z","title":"Schaul and J","venue":null,"work_id":"12a1e7ca-7f8d-4569-9fc1-525afe6f9492","year":2010},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.475072Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:a60927a96ca2603cc97696de61e3202b30c424ede6bf75cf755b6772b4bd8953","observation_id":"28e199e8-3641-487a-a636-1492a94fbc00","resolution":{"observed_at":"2026-08-10T21:34:36.907427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.885133Z","title":"Schmidhuber","venue":null,"work_id":"de296ecd-9e8f-45fc-92fb-268585c16550","year":1987},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.479819Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:307a13c634260e863eb8091ca6b9e56411c1af743539d8c3314c87a567b7fd0d","observation_id":"2ae740d4-afdc-4fcc-b674-b3b7deaec2e7","resolution":{"observed_at":"2026-08-10T21:34:36.889969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.871263Z","title":"Schmidhuber","venue":null,"work_id":"6d135317-0e3d-4352-b679-9d8198df0580","year":1999},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.485458Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:0efdf392a3a5eb6fb7e4d1b0c9fd80fedd9f44103008d76eb17c96dc7e8998bb","observation_id":"e215bbec-0b46-4a8b-8181-8509df3e1371","resolution":{"observed_at":"2026-08-10T21:34:36.875814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.490872Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.490872Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:aaca49a5825f9cbfaa2a669c69255e0ed2b0e3d58b0d7fe87b36123ab3a8982f","observation_id":"fcabd321-b44f-4286-88ca-3da27a5b362f","resolution":{"observed_at":"2026-08-10T21:34:35.490872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.842673Z","title":"Shinn, F","venue":null,"work_id":"5b7e6b42-6ad1-4803-a28f-6ce4c79d8cb1","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.497061Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:f959743b8061c4dc119b8557b5dbe6f5080c5256838654e9ff9046880219f3e1","observation_id":"46d187af-f7c2-4f15-ab81-a909bd26285e","resolution":{"observed_at":"2026-08-10T21:34:36.847748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.819049Z","title":"Silver, A","venue":null,"work_id":"4ebc6c72-f103-4b5b-a90d-a7a723904030","year":2016},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.501869Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:ce60556aece896122952a78fce87a0f2bda8ee672548ea96edc1f9007a7054a9","observation_id":"2e1b7217-daaf-4198-8a5a-83d67092de2e","resolution":{"observed_at":"2026-08-10T21:34:36.826926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.506314Z","title":"Silver, J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.506314Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:115856de5bff9f0143cef5c950af1c502778aa3e162edef9906d08be726ed2ee","observation_id":"30721518-8d62-404a-a00c-90492671ca67","resolution":{"observed_at":"2026-08-10T21:34:35.506314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.789993Z","title":null,"venue":null,"work_id":"70cfdf3d-2a54-4c15-bf6c-33b5064a6cec","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.514137Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:dd422df84687268ab65471d6f4e35a457ebd90572180de39db55e8cc0d2f5bd9","observation_id":"622fd121-1d72-4c7a-8940-df7fe757edb6","resolution":{"observed_at":"2026-08-10T21:34:36.794520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01081","last_updated":"2024-04-29T18:55:34Z","snapshot_observed_at":"2026-08-13T04:05:08.101953Z","submitted_at":"2024-03-02T03:48:37Z","title":"LAB: Large-Scale Alignment for ChatBots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01081","snapshot_observed_at":"2026-08-10T21:34:35.518320Z","title":"Sudalairaj, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.518320Z"},"links":{"cited_paper":"/paper/2403.01081","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:ab60a82df620e22ecbd14fe76e04ff77cd9c39a0f0093721556be4783db576b5","observation_id":"de6afcbe-64cb-4519-85b2-2a193a16f7bf","resolution":{"observed_at":"2026-08-10T21:34:35.518320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-10T21:34:35.523168Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.523168Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:381d179db68f06c7710d42a1ead04c28911f7602e57fd13b03652659a13a942c","observation_id":"5aa47013-f822-4ba3-bd82-29e57d74f91e","resolution":{"observed_at":"2026-08-10T21:34:35.523168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.774152Z","title":null,"venue":null,"work_id":"1af30ca5-0864-4f4b-9c83-70cf99b8ecf3","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.528275Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:47c510821cf17a5511a55ff240c56f8b97bbb5b8df8a43610348e576ade82308","observation_id":"b88f8223-f487-4038-8072-35647fa28bd9","resolution":{"observed_at":"2026-08-10T21:34:36.778848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.760148Z","title":"Tenenbaum and E","venue":null,"work_id":"64b1f055-c094-4f40-a27c-7aac5a6bb52e","year":1989},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.532809Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:567fd9dc72907d18beb3bdd56486892093190da0acc6c2d758ef3eda892a2bb1","observation_id":"38292c0a-2459-4ddd-80c4-20e34317a08d","resolution":{"observed_at":"2026-08-10T21:34:36.764526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.538223Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.538223Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:83f4e91d8f182891f37dfa32c5f651a6bda110f7779cefbae81ddab4c0f5950c","observation_id":"49f63fe2-1ca2-4fc9-8902-aafa98facb7d","resolution":{"observed_at":"2026-08-10T21:34:35.538223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-10T21:34:35.543022Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.543022Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:5e5e9f953892391fca2438cba733542883122d278f5bfc5ec188d94be9c721d7","observation_id":"07da72ab-9485-4eff-b109-686cc87aff44","resolution":{"observed_at":"2026-08-10T21:34:35.543022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T21:34:35.547860Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.547860Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:3c80c6fcb0bbb84b14157cfa527e4bfd1b54488091c7ef490b8e98b16059c1a8","observation_id":"84fd5bb2-6076-4f32-ba69-019c6427ff41","resolution":{"observed_at":"2026-08-10T21:34:35.547860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.737537Z","title":null,"venue":null,"work_id":"bf49e533-8fde-431f-b383-835841c80f79","year":2007},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.552315Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:fc861f70b98d219f7f15b818f82c859ecb186f2d1769f70f80414ea57ed2a34f","observation_id":"9c8b10f1-ac13-4b87-921f-85d627c45a9b","resolution":{"observed_at":"2026-08-10T21:34:36.742039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.556464Z","title":"Vedantam, C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.556464Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:7128467c191f63e16730881d9e5b29c3231f05395f7a2ac22680becca8e7ca89","observation_id":"df5ac0f1-faca-4b31-aae2-791b4ddaeca2","resolution":{"observed_at":"2026-08-10T21:34:35.556464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02325","last_updated":"2024-03-04T18:55:30Z","snapshot_observed_at":"2026-08-13T04:03:44.039520Z","submitted_at":"2024-03-04T18:55:30Z","title":"Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02325","snapshot_observed_at":"2026-08-10T21:34:35.560452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.560452Z"},"links":{"cited_paper":"/paper/2403.02325","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:bf563ef7d448a0bbcf2660dd24ddd625d1d21ae606fbf16ea1004c55dd20639a","observation_id":"ca17a4fe-520b-41ec-9472-18fda0b16f5b","resolution":{"observed_at":"2026-08-10T21:34:35.560452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-08-14T12:55:19.794078Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-10T21:34:35.564572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.564572Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:82670854b3115c0ee245a445bc82a2042d78ddc23631441da6a9b08b18831081","observation_id":"407d1acc-13bc-4ac8-89f7-d4b7fceafdf1","resolution":{"observed_at":"2026-08-10T21:34:35.564572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-10T21:34:35.569125Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.569125Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:a70387a4a9c2c948819a33e36b8c073a99e6a98774f0fdeedca7b5c7741d34c1","observation_id":"8066381b-7bc6-4b24-8c16-dff82742db3d","resolution":{"observed_at":"2026-08-10T21:34:35.569125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-10T21:34:35.573795Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.573795Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:d8f737c36c237edc32985a7909ac7435ff1734cb123ea2b99ba7d5f3181f694f","observation_id":"fb3bd056-b885-4e09-8458-b7ca1a314824","resolution":{"observed_at":"2026-08-10T21:34:35.573795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-10T21:34:35.579540Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.579540Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:9b7ee4d1693a71f7c788903d7d4d587bc8efb0418c923a6cc101662244b9823d","observation_id":"eb07f118-bb7e-425d-9a30-e11a15fd5a70","resolution":{"observed_at":"2026-08-10T21:34:35.579540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.714664Z","title":null,"venue":null,"work_id":"ae4ee900-236f-4bf4-9a95-fa5ee9bcc6e8","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.584821Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:d9109371c6cb92a6a6c2ecc9c39bf020de90755de323ab4b7fd8d56967c7c8c4","observation_id":"8d81d9d4-a9d7-4acd-8e69-4539c64f4c12","resolution":{"observed_at":"2026-08-10T21:34:36.719148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T21:34:35.589733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.589733Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:b8f25da6e886fa4718e960f6e2cf446270e0f4ea76abffe18e8bc3c7b0bd54a9","observation_id":"f3ccbcf4-4a0d-4a35-bdf9-792dde0fd88b","resolution":{"observed_at":"2026-08-10T21:34:35.589733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-10T21:34:35.594979Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.594979Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:8e31253d96fa103ff924661899126a731912610f427380f69f246c09b3c1af2b","observation_id":"77549c59-4f78-4c74-b2bc-8523a32e7d24","resolution":{"observed_at":"2026-08-10T21:34:35.594979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T07:51:50.203866Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":91,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 1 inbound Pith citation observation for arXiv:2501.04568."}