{"as_of":"2026-08-23T01:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1a3de820cfee93212d8cb7b5868f9b7f0bb50bc2dd2727ec52f762159752827","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:25:37.168330Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:15:39.766849Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T09:37:00.824668Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:b7e3c0f34625d3f8a410f9f3f61836e4686525a657f31301f9472c01b8a1ec12","observation_id":"ecbae974-0770-40b4-b6da-45b8cb86e6d2","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-08-04T17:24:30Z","snapshot_observed_at":"2026-08-15T16:43:34.966592Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:8f31eba55e95a0630c5252b95ba2f6b43037761bb20be438a1e2190536702388","observation_id":"3be3dc69-02b2-43c8-ba62-ad5c117f3a99","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.08644","last_updated":"2026-04-09T17:51:11Z","snapshot_observed_at":"2026-08-11T06:34:32.751399Z","submitted_at":"2026-04-09T17:51:11Z","title":"EXAONE 4.5 Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:47:34.692414Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.08644"},"observation_digest":"sha256:0d505c7bc2d124ab3bc4b0175cc1256b2f264c6a03cc00c516e097c71182c10f","observation_id":"9846bd0a-5d1f-42ee-ae57-920cd691042d","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T23:56:02.856878Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:ecb3877f9b480bb2ad990e60f6b9e005d6ba10d7e5b3fda6ce433c5e10bb8185","observation_id":"37bffe5c-46df-406f-b6b1-b7718587d055","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:8ffbda7a5bd7c70f32c7eeac6f66e4fd45b451a4d9c19ba37221a9051dc2009c","observation_id":"0eb02fec-f321-4728-bf03-db7c1a25d8e8","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.01402","last_updated":"2026-05-11T02:53:21Z","snapshot_observed_at":"2026-08-14T21:45:49.748028Z","submitted_at":"2026-05-02T11:49:03Z","title":"Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-09T14:36:29.666730Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.01402"},"observation_digest":"sha256:6cc30016c8b8fd380060826f2cd3826201d390e26362605f943cb54038adf0b5","observation_id":"5cbe58c9-2535-4f0f-b992-fe8167643885","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.01402","last_updated":"2026-05-11T02:53:21Z","snapshot_observed_at":"2026-08-14T21:45:49.748028Z","submitted_at":"2026-05-02T11:49:03Z","title":"Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-12T04:52:09.685243Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.01402"},"observation_digest":"sha256:d2e5a44a0d3d9fc5fb6532907cf4ad58a39a7a6e8e8c4c01692e5067e5d7215e","observation_id":"f8c77675-e600-4f98-9826-bd26e24b018d","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.09693","last_updated":"2026-05-10T18:25:52Z","snapshot_observed_at":"2026-08-11T14:36:51.006168Z","submitted_at":"2026-05-10T18:25:52Z","title":"Do multimodal models imagine electric sheep?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T03:24:01.933339Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.09693"},"observation_digest":"sha256:704a37ab47b2e48a36b3ff5bfa9da5f12499404329de507224fad64a77ad50ef","observation_id":"51fcbd8a-30ee-41a5-9c1b-2a117f04ae4d","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.09883","last_updated":"2026-05-29T22:33:55Z","snapshot_observed_at":"2026-08-17T17:15:03.146095Z","submitted_at":"2026-05-11T02:16:48Z","title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:54.053958Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.09883"},"observation_digest":"sha256:bcb4d6f795a8ca97f18653a7c7dee91945da6639fa4816c5563f0883a5687192","observation_id":"e69986e0-e556-419c-b975-eceda920f3c1","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.09883","last_updated":"2026-05-29T22:33:55Z","snapshot_observed_at":"2026-08-17T17:15:03.146095Z","submitted_at":"2026-05-11T02:16:48Z","title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T22:58:04.574536Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.09883"},"observation_digest":"sha256:154ca127e04e56980f40aacc0b76134499101ccf7d2a5600a6cf5ea1ef5258a2","observation_id":"17c6eedd-5c6b-498e-9742-17acee3eae00","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:823269b8b4dec3759c6a8fed07e52053ac63e6064a8d736280502c8566be8673","observation_id":"2eecc1b5-7e55-4014-b21c-e4c0d30ef38b","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.15672","last_updated":"2026-05-15T06:48:53Z","snapshot_observed_at":"2026-08-02T21:23:41.421731Z","submitted_at":"2026-05-15T06:48:53Z","title":"VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T20:14:34.739062Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.15672"},"observation_digest":"sha256:26bc82bb0dcec91ba06bb1d31a10b1e2bc140017d2fb0f19eb9a5c6c087d1ad1","observation_id":"b2c596a6-d638-446c-a9c5-1e75c5c40fd1","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-08-17T13:45:18.681762Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:0e5cebad523cf65cb896a87e10f8e939b58e069836f685a84e1961e98880392f","observation_id":"5851d4f6-769c-4b6f-92e9-0d896e34dc6a","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.19130","last_updated":"2026-05-18T21:30:54Z","snapshot_observed_at":"2026-08-17T20:39:21.641071Z","submitted_at":"2026-05-18T21:30:54Z","title":"EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-20T12:12:45.251924Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.19130"},"observation_digest":"sha256:74d63400f2365e2fd3a04e82208c0a32d314c8a0bb000cf2f2d9b2ee6d1a45b8","observation_id":"2127c17d-1a86-413a-9736-bdbbf64a8041","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.20942","last_updated":"2026-05-20T09:28:06Z","snapshot_observed_at":"2026-08-18T05:00:53.177234Z","submitted_at":"2026-05-20T09:28:06Z","title":"Bridging Structure and Language: Graph-Based Visual Reasoning for Autonomous Road Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T05:25:20.511933Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.20942"},"observation_digest":"sha256:e8ff4c2ec9443765348e9b0e5a39d978fd73bd791304882826e55d8bbac714fb","observation_id":"04dbbbd5-7c41-42c4-8c80-707d31f8d328","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:fe18f810575b3abdcfa9b192acacdf8858a3399341ed5320c6422b17dc79b902","observation_id":"3ebebce8-606e-4713-9819-be895d60852c","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.01667","last_updated":"2026-06-01T04:19:50Z","snapshot_observed_at":"2026-08-03T01:20:45.755599Z","submitted_at":"2026-06-01T04:19:50Z","title":"ATLAS: Agentic Test-time Learning-to-Allocate Scaling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:27:28.290178Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.01667"},"observation_digest":"sha256:f147f4d36bd034d288a98438f373c7325a3525a6b922c781ee50b823de348a3a","observation_id":"187c584c-1f2d-406b-94cd-aa8f92e5307c","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.05497","last_updated":"2026-06-03T22:41:11Z","snapshot_observed_at":"2026-08-18T03:33:25.604662Z","submitted_at":"2026-06-03T22:41:11Z","title":"LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, \"Is Your VLM Smarter Than a 5th Grader?\")","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T06:39:08.246174Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.05497"},"observation_digest":"sha256:6765cc68e753be3cdcd128ff0b14ed3c36c8f12c490c829fd22bb9db301aa8d4","observation_id":"abdb3657-0c8e-497f-a05f-882bf39451c9","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-10T09:12:54.601851Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:1e3c570e6ec8f59fd22cae5a3bdca07851f37dbebb7a2b97bf4ecdd931f3c68e","observation_id":"381440d4-1561-4548-a217-0477d06c4de3","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-20T08:49:43.330266Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-25T21:23:10.051805Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.25319"},"observation_digest":"sha256:6a5b54da5c421ea98692704afeec436f915d83c147e80885b13d1dc4c8d0f9de","observation_id":"27ad2c73-da42-4e3e-a21a-860c8bceef53","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-12T14:16:56.866074Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:d9da20efb6e59fbca28251592cf96be217c66a50b2f3aa4b04d4c652067d89ab","observation_id":"dba8cbd6-253b-42d7-a467-25bf97e808a5","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:47fc274690e05ba508ff3e4ecc384a5e018bac21c60e53cd5c31e8bd4eac9542","observation_id":"71f17e32-ee9b-4509-b9e9-2e4ec44e263e","resolution":{"observed_at":"2026-07-10T09:37:00.825956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-14T05:37:19.632869Z","title":"arXiv preprint arXiv:2601.06521 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11436","last_updated":"2026-07-17T15:34:16Z","snapshot_observed_at":"2026-08-13T18:29:27.819584Z","submitted_at":"2026-07-13T11:44:23Z","title":"The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T05:37:19.632869Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.11436"},"observation_digest":"sha256:b745b0f6dffb4d0a71be560c6ca8699f57f5ab3a73abb27543b669de091379d3","observation_id":"5f823fbd-a930-48f6-a4e3-720357328807","resolution":{"observed_at":"2026-07-14T05:37:19.632869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-02T07:01:19.711542Z","title":"arXiv preprint arXiv:2601.06521 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11436","last_updated":"2026-07-17T15:34:16Z","snapshot_observed_at":"2026-08-13T18:29:27.819584Z","submitted_at":"2026-07-13T11:44:23Z","title":"The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T07:01:19.711542Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.11436"},"observation_digest":"sha256:670cd06ab06941f67639a01dfd15f694f337a7b6b7587179f849d81618267292","observation_id":"17b1b511-f44e-4f07-b535-a58fa7242f42","resolution":{"observed_at":"2026-08-02T07:01:19.711542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-01T21:12:03.005752Z","title":"Babyvision: Visual reasoning beyond language.arXiv preprint arXiv:2601.06521, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16165","last_updated":"2026-07-17T17:46:23Z","snapshot_observed_at":"2026-08-19T12:48:08.953520Z","submitted_at":"2026-07-17T17:46:23Z","title":"An Exam for Active Observers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:12:03.005752Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.16165"},"observation_digest":"sha256:997d381664217fc3a7d647d7365ba917eb15f27217c98ee19eebf4e7daeb7775","observation_id":"c4384486-1fbb-4686-9187-89c420c32b05","resolution":{"observed_at":"2026-08-01T21:12:03.005752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-15T15:32:27.377351Z","title":"Babyvision: Visual reasoning beyond language.arXiv preprint arXiv:2601.06521, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22864","last_updated":"2026-07-24T19:09:25Z","snapshot_observed_at":"2026-08-17T12:59:56.492496Z","submitted_at":"2026-07-24T19:09:25Z","title":"Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:32:27.377351Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.22864"},"observation_digest":"sha256:88721130e139e06128f48c781f3261938d547dd4cc9f980dcc8dc1af52c312bd","observation_id":"0986a07a-a4f6-43b1-a070-8b88c1d6301c","resolution":{"observed_at":"2026-08-15T15:32:27.377351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-02T11:50:20.183933Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24771","last_updated":"2026-06-10T13:33:10Z","snapshot_observed_at":"2026-08-21T01:49:57.357837Z","submitted_at":"2026-06-10T13:33:10Z","title":"RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:20.183933Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.24771"},"observation_digest":"sha256:f481e918a0a14f15573268f60d39a8b42dead98a19ecff70640de17c8740fded","observation_id":"747b163b-6bef-4176-97fe-c820f1d48fc4","resolution":{"observed_at":"2026-08-02T11:50:20.183933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-31T05:01:28.838169Z","title":"arXiv preprint arXiv:2601.06521 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-21T14:55:50.109713Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.838169Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:899c43ff5789f868312974cb32a1281c8570c4cd9efd85df4eee3c68c17f09a6","observation_id":"d51a5525-1455-4600-a670-736d17b93e09","resolution":{"observed_at":"2026-07-31T05:01:28.838169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-31T02:45:28.580613Z","title":"Babyvision: Visual reasoning beyond language","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.580613Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:a78cd2c07f098a45253f5951ffd3168c06d171dd369fee0533c4933410427e62","observation_id":"52f1f3d1-c9a0-418c-9ea2-43d2dd02a6fd","resolution":{"observed_at":"2026-07-31T02:45:28.580613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-11T00:36:22.121965Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-19T20:31:12.907646Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.121965Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:4f4106c6d5c77a337d0ff0cfb2f9e49be3f435529debd085b4595cd852c1c587","observation_id":"16cf6ca3-e2f6-4e97-8a37-0cf641434036","resolution":{"observed_at":"2026-08-11T00:36:22.121965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-16T00:15:39.766849Z","title":"Babyvision: Visual reasoning beyond language.arXiv preprint arXiv:2601.06521, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12262","last_updated":"2026-08-12T17:04:13Z","snapshot_observed_at":"2026-08-18T04:34:32.279897Z","submitted_at":"2026-08-12T17:04:13Z","title":"Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:15:39.766849Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2608.12262"},"observation_digest":"sha256:ed69979a1b199923c8dc29ebdb95918f684f6d4d098b3a3ce3b8fd465eafe9ec","observation_id":"4069ec4b-08de-4012-854e-4aafb89148dd","resolution":{"observed_at":"2026-08-16T00:15:39.766849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.06521/citation-record","integrity":"/paper/2601.06521/integrity","json":"/paper/2601.06521/citation-record.json","paper":"/paper/2601.06521"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.254842Z","title":"Accessed: 2025-01-09","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.254842Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:c388731321bd14ae8b2695820fb59a734e67b0afb0f02ff4750b5d74f50a71df","observation_id":"2de732fb-c481-4680-b05a-50591f5ae38a","resolution":{"observed_at":"2026-08-03T11:25:36.254842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.324358Z","title":"Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, and Feng Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.324358Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:01792969d417ff34f8e439f128a957392bd7aa14bbf5c069d2042fb7b0ec871f","observation_id":"bfb5f875-3479-4275-8e03-d259b1939353","resolution":{"observed_at":"2026-08-03T11:25:36.324358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.583244Z","title":"Accessed: 2025-01-09","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.583244Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:bd81764ed5cd2be394331de150c4c5ec65d5160d907a179dde2abfd1cfc49822","observation_id":"801ef178-dbe7-43fd-9ae7-febbc2b9b640","resolution":{"observed_at":"2026-08-03T11:25:36.583244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00468","last_updated":"2025-02-27T15:10:56Z","snapshot_observed_at":"2026-08-21T07:42:34.346954Z","submitted_at":"2024-06-29T15:28:45Z","title":"MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00468","snapshot_observed_at":"2026-08-03T11:25:36.655028Z","title":"Scott P Johnson","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.655028Z"},"links":{"cited_paper":"/paper/2407.00468","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:40fdf8d7b1b60c3e324f2b2dd660ee6c34988275d2633b0e687ecc1c533544ed","observation_id":"4af5246c-d98b-474a-b118-4a42e8a91ecb","resolution":{"observed_at":"2026-08-03T11:25:36.655028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.738689Z","title":"Accessed: 2025-01-09","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.738689Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:83d72f8905a8cfe132f84807cd51bfcde22dc937e9bf9032ce3a4c01aae29958","observation_id":"d0e1e774-3d1e-47c6-846e-c86c5eabbe7f","resolution":{"observed_at":"2026-08-03T11:25:36.738689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-03T11:25:36.780815Z","title":"Guangming Sheng, Chi Zhang, Zilingfeng Ye, Xibin Wu, Wang Zhang, Ru Zhang, Yanghua Peng, Haibin Lin, and Chuan Wu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.780815Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:0f12dc67c767e118c38b90cb34487a3f2e8136f324dbeaa41e5dd76efbc3fa86","observation_id":"d644983c-2a3e-4d98-8be0-1c4e66419cdc","resolution":{"observed_at":"2026-08-03T11:25:36.780815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.862991Z","title":"Core Team, Zihao Yue, Zhenru Lin, Yifan Song, Weikun Wang, Shuhuai Ren, Shuhao Gu, Shicheng Li, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.862991Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:2a683429739cd70ad7e634a1f4b325482d738c394d0c88889febf80a250eea42","observation_id":"bdaee791-7db0-4c97-bf96-ee1f340191ed","resolution":{"observed_at":"2026-08-03T11:25:36.862991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-03T11:25:37.014871Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.arXiv preprint arXiv:2402.14804,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:37.014871Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:cf810e8c32483a99570f05881975051f2e8ae6801b666bd59752499cdd896aa4","observation_id":"fc4343a4-c7c2-4d2a-a26e-0760b32da638","resolution":{"observed_at":"2026-08-03T11:25:37.014871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T11:25:37.086374Z","title":"Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:37.086374Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:1ff53b6d20d8846359f0c15484d55044bb0a523dbf6c441101ca33c152288b5e","observation_id":"f743877f-9b8b-4328-956c-c8e6acb7a2e5","resolution":{"observed_at":"2026-08-03T11:25:37.086374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24173","last_updated":"2025-05-30T03:33:25Z","snapshot_observed_at":"2026-08-17T15:47:45.736345Z","submitted_at":"2025-05-30T03:33:25Z","title":"DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24173","snapshot_observed_at":"2026-08-03T11:25:37.168330Z","title":"Drvd- bench: Do vision-language models reason like human doctors in medical image diagnosis?arXiv preprint arXiv:2505.24173,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:37.168330Z"},"links":{"cited_paper":"/paper/2505.24173","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:4e8aab6990a91541fb07592add868f20751c7a8d7b651e4719fcc7b924b3a85e","observation_id":"e54c4f02-70dd-455d-bed4-3f1f0daa5138","resolution":{"observed_at":"2026-08-03T11:25:37.168330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-08-20T14:04:31.329156Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-03T11:25:36.947259Z","title":"Glm-4.6v: Open source multimodal models with native tool use, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.947259Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:0889299dee36760a3bb31008ae701459cd93182e6db5bdaf0e785d9c908c7e66","observation_id":"241372c7-3494-44a1-a7be-4c5019d3e86e","resolution":{"observed_at":"2026-08-03T11:25:36.947259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-03T11:25:36.510939Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.510939Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:ae7c5676ebcc612c7f0fef6414be408aeaf0b084550cb81a9313f81ba159e536","observation_id":"4882c10a-7f71-48fa-8989-421a225fdd51","resolution":{"observed_at":"2026-08-03T11:25:36.510939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T11:25:36.210179Z","title":"Renée Baillargeon, Elizabeth S Spelke, and Stanley Wasserman","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.210179Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:78854ed1017d8d57665c532cefdc80244b24f20adbc5ba94dbb14b864c645421","observation_id":"768ad5cf-84db-4e70-a90b-7928f392fe03","resolution":{"observed_at":"2026-08-03T11:25:36.210179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 31 inbound Pith citation observations for arXiv:2601.06521."}