{"as_of":"2026-08-06T16:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d22e09c4112ee42609104bca58e2240cdb1b42d897101ddc8d38c53e3478ff1","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T22:02:21.638064Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:26:29.353201Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T04:26:29.688144Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2604.09025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09025","snapshot_observed_at":"2026-08-05T04:26:29.688144Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","venue":"cs.CV","work_id":"cf54a7c4-50c0-486a-8535-5070feb4b1ca","year":2026},"citing_paper":{"arxiv_id":"2608.02636","last_updated":"2026-07-31T04:02:51Z","snapshot_observed_at":"2026-08-06T15:31:15.214446Z","submitted_at":"2026-07-31T04:02:51Z","title":"Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T04:26:29.353201Z"},"links":{"cited_paper":"/paper/2604.09025","citing_paper":"/paper/2608.02636"},"observation_digest":"sha256:df044db6b5565998007460536b73494bb61574f8dae0e14d2271bfe87e692032","observation_id":"b8a5a7d7-7938-4c98-a4ca-d13e1c76c8ca","resolution":{"observed_at":"2026-08-05T04:26:29.691085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.09025/citation-record","integrity":"/paper/2604.09025/integrity","json":"/paper/2604.09025/citation-record.json","paper":"/paper/2604.09025"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"398bbca4-3bee-4c45-81b4-2394aab50ed4","year":2022},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:0bb707276a00f428443af02f277673f1fa494e4a8a068c89efa486c3c760fb29","observation_id":"97620e12-9ddd-4ecd-b2b4-afdfa920ae53","resolution":{"observed_at":"2026-05-14T22:03:03.952837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c8df34f-9ea9-4a8b-99ee-ad8397b045dc","year":2021},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:19af570cc1b0640f5c9cbf059db542119987b24132800c9f8d4b7090a7437597","observation_id":"381c63f0-01b7-452b-87b8-5babacb88ed3","resolution":{"observed_at":"2026-05-14T22:03:03.934957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7727139d-d312-4493-8937-3c7226b6f78e","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:cc5e9dc9ee2ccaf5e0c3fb772c82de11904c3e55c71cd9fd2959b5103b2aff3d","observation_id":"1c84d3b2-bee0-4fab-9b60-6932980333e1","resolution":{"observed_at":"2026-05-14T22:03:03.930890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08907","last_updated":"2026-07-02T13:52:05Z","snapshot_observed_at":"2026-08-01T12:02:26.268295Z","submitted_at":"2024-12-12T03:39:44Z","title":"Towards Interactive Global Geolocation Assistant","version":3},"cited_work":{"arxiv_id":"2412.08907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08907","snapshot_observed_at":"2026-07-03T02:17:04.954456Z","title":null,"venue":null,"work_id":"bd6959f4-1b27-4690-9a29-a7f27b2d1b55","year":2024},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2412.08907","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:e3ecf225b9e6281239590c24384cd4ebd4239315564da48bcfeba805e3f36e8b","observation_id":"82601659-7706-4d78-8f36-8079aed23aa1","resolution":{"observed_at":"2026-07-03T02:17:04.954456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:9373e645d5bc361a1b92363584f90a296e439edc259086ef0ce3b13ee4188b64","observation_id":"0683996a-7b92-49b3-9992-3d6897d9e004","resolution":{"observed_at":"2026-05-14T22:03:02.513687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00275","last_updated":"2023-02-01T06:44:07Z","snapshot_observed_at":"2026-07-06T14:46:56.842264Z","submitted_at":"2023-02-01T06:44:07Z","title":"Learning Generalized Zero-Shot Learners for Open-Domain Image Geolocalization","version":1},"cited_work":{"arxiv_id":"2302.00275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.00275","snapshot_observed_at":"2026-07-02T21:07:23.782659Z","title":"Learning generalized zero-shot learners for open-domain image ge- olocalization","venue":null,"work_id":"897821cf-56a6-4c61-baa6-ed563d0243eb","year":2023},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2302.00275","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:d2ec7a534212f90b9fccc9e1c04a539beb18cb9a2c392842dc570216352a0b35","observation_id":"76235d0e-67f4-4359-a046-3b2867a8c128","resolution":{"observed_at":"2026-05-14T22:03:02.527679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e0e8c681-4475-4f27-9dd0-eef3bf92aec5","year":2024},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:3647839fe97d51176b1b8b97a1e8f1be82342c2cb5bc03c35e220f552224cb91","observation_id":"8257e46b-72b1-4c59-aef1-38800cb49179","resolution":{"observed_at":"2026-05-14T22:03:03.944480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bc89000b-8ac6-4a5a-aba0-982f00273b8c","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:07a026fbf19be5e0796f75642e1690247ba6f36806e05631c937ec30112c237f","observation_id":"2414829d-1d5e-4341-a8de-d17a7598541a","resolution":{"observed_at":"2026-05-14T22:03:03.940395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05432","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:50.717379Z","title":"Thinking with map: Reinforced parallel map-augmented agent for geolocalization.arXiv preprint arXiv:2601.05432, 2026","venue":null,"work_id":"0337b3db-28fe-44f7-beb3-a9e8fc8e39f5","year":2026},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:d6ef0df080c6c900cbebe80d18a93f04b9d84e4ba21d6b9ea4af3def351c5b5d","observation_id":"c15eae55-700b-47f6-ab3e-7bdafb6de01c","resolution":{"observed_at":"2026-05-14T22:03:02.501334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"17a2ae7b-3c1e-47d8-b877-79fef460200d","year":null},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:549d3218b9c5e0d641d1775dd94d64208d6f484478476d1763ef991a2e52731c","observation_id":"b80183a8-3c95-43dd-bd21-80466317d742","resolution":{"observed_at":"2026-05-14T22:03:03.948574Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09463","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:50.737688Z","title":"Spotagent: Grounding visual geo-localization in large vision-language models through agentic reasoning","venue":null,"work_id":"e895e308-134a-4869-ad98-5146e0d13b8b","year":2026},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:0bb44a473881621dae57394bc8b11f5c2add8a93882686014f2d19de76ce3868","observation_id":"93cfe76d-4dd7-40bf-8bd9-4a7a184bd487","resolution":{"observed_at":"2026-05-14T22:03:02.507287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13731","last_updated":"2026-06-24T08:21:04Z","snapshot_observed_at":"2026-07-06T21:26:40.118249Z","submitted_at":"2025-05-19T21:04:46Z","title":"GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization","version":4},"cited_work":{"arxiv_id":"2505.13731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13731","snapshot_observed_at":"2026-07-02T20:47:22.984867Z","title":"Georanker: Distance-aware ranking for worldwide image geolocalization","venue":"cs.CV","work_id":"8d52808e-a083-45bb-9347-494ba78cb0ba","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2505.13731","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:c94b84160db55f4540dc92688b4929d5d771e563678ab7b971bd1549e0323074","observation_id":"babc29e8-9bee-4334-9a62-9efb219dbec4","resolution":{"observed_at":"2026-06-25T02:17:29.888408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12617","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:50.711678Z","title":"Geoagent: Learning to geolocate everywhere with reinforced geographic char- acteristics","venue":null,"work_id":"8610c278-9736-4f82-a950-402667d2a4af","year":2026},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:490f70130a7d33852cde30831d3588929f24a31b40625b8008b63e7218b37e82","observation_id":"6c4f2773-1909-43e8-bd0e-b4be560ec00f","resolution":{"observed_at":"2026-05-14T22:03:02.403364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.18572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T23:06:20.246138Z","title":"arXiv preprint arXiv:2406.18572 , year=","venue":null,"work_id":"9f2c630c-c7a5-464a-8ecc-4557cc8160b2","year":2024},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:b196064a6908cc2d0280ce712385269619e9f37c4de2a71d7ac0ca2b05bf262f","observation_id":"e055c249-feba-4136-aaed-05fccc9f1962","resolution":{"observed_at":"2026-05-14T22:03:02.420867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T23:06:20.263295Z","title":"InInternational conference on ma- chine learning, pages 19730–19742","venue":null,"work_id":"758fb6e2-53e5-412e-a0c6-658ea41fd24b","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:da785f6a698acb9eb5cf95d7b0f9aa420d8c0a55da89b7e5ab112187b9306393","observation_id":"a48897dc-490a-44ad-8b91-5ed593b02c2c","resolution":{"observed_at":"2026-05-14T22:03:02.392517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19155","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1a483544-2d22-49a8-b143-9c7b0684a43a","year":2026},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:d3a10d9d301ed74ac6fac26f6a14be3de8d62f4df7c49e493bfab1a570f42d32","observation_id":"99919502-1b05-4f23-b7da-aed2a2a916bd","resolution":{"observed_at":"2026-05-14T22:03:02.397864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09474","last_updated":"2024-08-18T13:39:43Z","snapshot_observed_at":"2026-08-05T18:35:37.834773Z","submitted_at":"2024-08-18T13:39:43Z","title":"Image-Based Geolocation Using Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2408.09474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.09474","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0e0a23ab-cae3-463d-a47e-bf3396f5196f","year":2024},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2408.09474","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:1d5a9b968658a5079320bb7d92442ff087a2703948601ae7d1046f3b20acbdfa","observation_id":"93730a1d-8dec-4599-9168-76cc5df42f61","resolution":{"observed_at":"2026-05-14T22:03:02.439499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21460","last_updated":"2025-03-27T12:50:17Z","snapshot_observed_at":"2026-07-06T20:59:35.694800Z","submitted_at":"2025-03-27T12:50:17Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","version":1},"cited_work":{"arxiv_id":"2503.21460","doi":"10.1145/3573051.3596191","metadata_source":"pith","pith_arxiv_id":"2503.21460","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","venue":"cs.CL","work_id":"4aff48d9-c46d-41d9-904b-52251e559596","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2503.21460","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:d3892781f24f44f0cc391d0738770ae7847cca7999614728c9cbb13c73e92cbd","observation_id":"a1447e4c-1cf3-48b4-9e27-33b5dc51811a","resolution":{"observed_at":"2026-05-14T22:03:02.457646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"908a8602-380d-40e0-8201-d62668e52cbf","year":2018},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:5a38e1eaf14cc9a876c88a9186f9bbabf3590aa456c9f38423dfe37d47f92c34","observation_id":"8ee8921c-b736-4d16-a86f-0be658eb44c6","resolution":{"observed_at":"2026-05-14T22:03:03.884910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:26:12.372824Z","title":null,"venue":null,"work_id":"b2b8e4c9-2223-47d1-b0bb-83573eb2e28b","year":2022},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:47e30b343350a08d433c8f103249f1aa95f95f7b92ab543c29820501b3ae87dc","observation_id":"490b8cd2-1273-4d82-8601-0f7aac8a03de","resolution":{"observed_at":"2026-05-14T22:03:03.888854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0efdc923-7c0b-46c0-a5a8-4517841244ea","year":2022},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:088284f0a6c2acb69d34274892971bef98535032485fe433e092e0d00fed2a0b","observation_id":"ced73e7b-7eaf-408d-bab0-e1827bd378fe","resolution":{"observed_at":"2026-05-14T22:03:03.897491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10880","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Where on earth? a vision-language bench- mark for probing model geolocation skills across scales","venue":null,"work_id":"0575f2e6-651e-40a6-a0a3-d021e19cb6dd","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:a81b030047ea6602bf21bf864eb560285d01791d19f9e6d48e8f439f45b1b150","observation_id":"c1ee5605-eaf7-470c-bca3-924644f2c722","resolution":{"observed_at":"2026-05-14T22:03:02.380343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e217962-6041-47a9-969c-6dbfc93cf8be","year":2023},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:e14fe245500bcbd9847cc4ab0d143586e8932011ec9628af9fac7e86a1fec815","observation_id":"c0841724-e18e-4c4b-aa8e-3dd9d50ab12f","resolution":{"observed_at":"2026-05-14T22:03:03.914739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:1fbdf046cbf0ce4f5e3d75987876562977109299f9d07e424cf92830c5253498","observation_id":"578d579f-5fe4-4d61-a184-6a7e758948e7","resolution":{"observed_at":"2026-05-14T22:03:02.463695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:46:13.589678Z","title":"2009.The probabilistic relevance frame- work: BM25 and beyond","venue":null,"work_id":"c5b9fddc-99bb-416c-af3d-14708f36353c","year":2009},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:1fcad1b4825eb8b5cb5a76bb0b10aeedf4c5c1efa60680303f717c7be02ed6b3","observation_id":"32ecef52-28b4-4c5b-a8c2-4a1ecd3672e8","resolution":{"observed_at":"2026-05-14T22:03:03.906126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"969f86cb-bdfe-4038-9c73-3d5276c82d15","year":2018},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:6a1fa0bf9680fb7dd66b42a6c166d386fceb7aa4bd6496690d046118ab3e2588","observation_id":"729f955f-568a-43da-8aaa-f7ead69a852c","resolution":{"observed_at":"2026-05-14T22:03:03.922900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13759","doi":"10.48550/arxiv.2502.13759","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.13759 (2025)","venue":"TUbilio (Technical University of Darmstadt)","work_id":"53228e0c-1000-4d30-b06f-3898d7e89cce","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:d6686c53d637f19fc0f8feaed81fabffa4c01ff31303c5f439600a5ff410c704","observation_id":"5324c029-7622-4f9f-8bdc-a1ca15ce913e","resolution":{"observed_at":"2026-05-14T22:03:02.432902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21278","last_updated":"2026-04-20T16:58:56Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T05:18:40Z","title":"GeoRC: A Benchmark for Geolocation Reasoning Chains","version":2},"cited_work":{"arxiv_id":"2601.21278","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21278","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GeoRC: A Benchmark for Geolocation Reasoning Chains","venue":"cs.CV","work_id":"98f78b7d-99cb-47c6-b159-86682ecadd71","year":2026},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2601.21278","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:036e62984463527b1c1f824ea6cbbfb2613dc1af32682759fa28b69edab0558a","observation_id":"06dfa5f6-035a-4b52-b25c-3f8d8c9cb397","resolution":{"observed_at":"2026-05-14T22:03:02.426796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:cdf0635d3abae7db16e638edfe556ae215ebb993f0cee3911111928c77c5bdef","observation_id":"40f85801-0ed4-4e6c-8310-b88036a88c14","resolution":{"observed_at":"2026-05-14T22:03:02.469575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7d39c88f-afe3-41f1-be08-92e6a3c66822","year":2023},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:9af13505a5d5cbdf12ebc3b40b57423bb882be68059fe5d88f168054bc9698c0","observation_id":"96e61cf7-a52a-443a-afb5-20801937291c","resolution":{"observed_at":"2026-05-14T22:03:03.877213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e3260aec-70c1-473b-94e1-177c5b4d983b","year":2017},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:46224c7e2607f4c78ee8cee09b752a9a2cba6480dc26837c94905bc15b2f427d","observation_id":"9a7c8ba6-4821-440d-9af2-9ec25d68a49b","resolution":{"observed_at":"2026-05-14T22:03:03.881285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce4843e0-4519-4c76-b08e-812721d15ca7","year":null},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:a1c134a34622be7083be143aacab032c89273abf4823c4a533ece9ddcacbbdc8","observation_id":"267e2eba-f0df-4bcc-902e-25bf599a30d0","resolution":{"observed_at":"2026-05-14T22:03:03.873339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:02:46.185355Z","title":"Gre suite: Geo-localization infer- ence via fine-tuned vision-language models and enhanced reasoning chains","venue":null,"work_id":"1011931d-53f8-42ed-b983-5008c7c7f2cb","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:7a1c0f4101245e7113265b6ed888e1dc02ea065cbaa14a5494aaca75e273c4a8","observation_id":"7ef9a703-ce6e-4518-96b2-07035b535172","resolution":{"observed_at":"2026-05-14T22:03:02.409447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a10a69e9-9e7c-4cf3-ad0d-6680f8999f84","year":null},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:53647941a5c179bc02e9ffc24c1628b62d0f805bdbaee38a4c5344d078410c89","observation_id":"4ad7476e-91bb-420f-8764-48227d92638f","resolution":{"observed_at":"2026-05-14T22:03:03.901778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:42.485673Z","title":"arXiv preprint arXiv:2511.15705(2025)","venue":null,"work_id":"83940634-73ba-44f4-8076-a978f10aa4ed","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:f8f908fca050ff0b4d938705875c2e31bd81e9eecafb02e7d4da1b7f27151223","observation_id":"d68f03d0-661a-4509-bafb-366103851500","resolution":{"observed_at":"2026-05-14T22:03:02.415095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"343cc208-b5f6-4ba5-996f-3983ed89caa3","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:8d2539f55c9cd56231f1cb65aa1060c9d565ede9f20c5a843d094521be6f8041","observation_id":"f15c18f4-0f68-4450-89a2-2de3d4446d4a","resolution":{"observed_at":"2026-05-14T22:03:03.865798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"208e287e-2360-4065-b72e-f5b5f3a90194","year":2016},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:3428bdd12ea43b87f4750d12787e8f6c3595a897c9b693611548509dc72c264c","observation_id":"a8f3452d-f07c-4e80-9f41-ec167f128f92","resolution":{"observed_at":"2026-05-14T22:03:03.869601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2daee6a5-2656-48cb-b56a-7e2b8fe33ce3","year":2024},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:5ab1cb1e24322eae5157749ff5841e25e4805116813ac78b40440a5edc8d584d","observation_id":"3a40b466-ce4b-46c9-8535-f86417aef9fe","resolution":{"observed_at":"2026-05-14T22:03:03.892789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12430","last_updated":"2026-06-02T16:14:54Z","snapshot_observed_at":"2026-08-06T11:11:16.632352Z","submitted_at":"2026-02-12T21:33:25Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","version":4},"cited_work":{"arxiv_id":"2602.12430","doi":"10.48550/arxiv.2602.12430","metadata_source":"pith","pith_arxiv_id":"2602.12430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","venue":"cs.MA","work_id":"a64d3985-6826-492c-8a2e-f0965d805bfd","year":2026},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2602.12430","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:d153fce969d2db99136a7d1627ef593273c05d5795a6e0bae507b7e3a10df269","observation_id":"fef360c7-75e7-47b1-a96c-992e0e134226","resolution":{"observed_at":"2026-05-14T22:03:02.494812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5d6c1644-af5e-4eeb-9de7-b6282f399703","year":2024},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:dd4de5bee82fff1d58d336eb4eedada3ef4fe2448d64c72ccf9db9277fbfed5b","observation_id":"7ad2960f-def3-4fdf-a51c-2cbe2af1f69e","resolution":{"observed_at":"2026-05-14T22:03:03.926625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.13628","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c4706c6c-33e7-4c90-b1f4-f25e84a8ef79","year":2026},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:60b3806168d5f85e5dd90cd9b2f71a5ba64913919c4543d456440da2185ceb36","observation_id":"c0019406-f2b1-4535-bb51-2e17f9fba533","resolution":{"observed_at":"2026-05-14T22:03:02.445564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:11093d2ab72506f4cbb213fa0cbd3ae9bebf1e1e82c79367ef2adc0464e99457","observation_id":"838933d3-d040-4b9f-8a80-1f65a8cb01b4","resolution":{"observed_at":"2026-05-14T22:03:02.487690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:a9d3bc56fdf241d468b98f0f52a74a587cc9aa34590598122c1561b764342d57","observation_id":"885bc6ed-ba76-4af7-a221-3c6016aaa22d","resolution":{"observed_at":"2026-05-14T22:03:02.481797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:2937f67405ac4f012d3544213455f2e36efba19abc4dac725e61c1d224bd87e8","observation_id":"c42c2bff-62a4-439f-b77c-80512802e6c2","resolution":{"observed_at":"2026-05-14T22:03:02.475634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2511.00908 (2025)","venue":null,"work_id":"ab4ef96a-b2ea-4598-aebc-900ce04e18e7","year":2025},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:1c0c8d18452799d67f29925ea875d1821e71455af12876249e42b2efe1e8281a","observation_id":"070be554-bf80-4605-8f07-ad0cbcf2230e","resolution":{"observed_at":"2026-05-14T22:03:02.386106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2b779d07-38b1-43de-af28-34e9e387970d","year":2018},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:e9130a0dad3bcf49182eb341d870ea4a55a38861975ab63d8b91e8c3431c45fc","observation_id":"4ea56c83-8f85-465b-a269-72f633754602","resolution":{"observed_at":"2026-05-14T22:03:03.919158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d4fc0e92-7095-4e97-8d2e-af43ca97551b","year":2022},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:14ddcb57fc554623549ba5f1b806decf761e363a1e3bdd1f61c8a25e7e15df91","observation_id":"17e20a23-6890-4f4f-8b21-edd4b6e19b74","resolution":{"observed_at":"2026-05-14T22:03:03.910629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:21.638064Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2604.09025"},"observation_digest":"sha256:965bd32dd6bf7d6906b961ad198909533311fd0118806c0d756c6669dffe5a2f","observation_id":"5e033a25-94c5-4d71-86ad-51856d84f2b2","resolution":{"observed_at":"2026-05-14T22:03:02.451683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.09025","last_updated":"2026-05-13T04:36:07Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:43:48Z","title":"Skill-Conditioned Visual Geolocation for Vision-Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":26,"verified_fuzzy":1},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2604.09025."}