{"as_of":"2026-08-17T03:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b98be9f8b79ce81d5ed85fbb028e0f28dafb8ee5af0dfb13060ade9f910192bd","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:26:12.042623Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.14212/citation-record","integrity":"/paper/2506.14212/integrity","json":"/paper/2506.14212/citation-record.json","paper":"/paper/2506.14212"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T00:26:11.382113Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.382113Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:9c6d16df06b1f7e32cc9a3bb08f190f8f8b8b22c4c077fade400359d38f8d384","observation_id":"385b030a-9cc5-4368-b3ea-06f97f901133","resolution":{"observed_at":"2026-08-07T00:26:11.382113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.582376Z","title":null,"venue":null,"work_id":"5cf493fb-f0b1-4e78-8b7c-1d2042c7bc41","year":2004},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.414488Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:78b49c82c70bef7e50cb1f3b9fbfdb0eecffe7f674e5bf512050e3c0db26669a","observation_id":"82f9cab2-a993-450d-a82c-562973a01e4e","resolution":{"observed_at":"2026-08-07T00:26:12.586059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.570525Z","title":"W., Hamrick, J","venue":null,"work_id":"764eae07-f317-46ee-b98c-640199aca9eb","year":2013},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.430076Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:2c1f6f8a7df550845ad5ebac1650ae4a8fc4b7527fc8c2c8d2edd3c05b2a7f39","observation_id":"33b90856-ecce-43d1-af09-4f9abd663b79","resolution":{"observed_at":"2026-08-07T00:26:12.574404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.559299Z","title":"W., Jacobs, R","venue":null,"work_id":"269ae0b6-4869-4ad9-8e43-511107549cf3","year":2003},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.457000Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:decc26f3fe233383ca1dea19dc6893f277426e6d7a84ac851d98b059c735b84a","observation_id":"45f3a86f-a750-4e4b-aab4-5a1b06c41630","resolution":{"observed_at":"2026-08-07T00:26:12.563160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.546524Z","title":"A., & Wang, H","venue":null,"work_id":"8d2508f4-3c8c-49c7-9cd3-e686289c1385","year":2022},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.481733Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:bd999d6ca1012f8fb95709311ba997050b5caaa66594a78911e72a33618beb7c","observation_id":"ff9a41fd-a8b5-4214-8930-59fdd11c4630","resolution":{"observed_at":"2026-08-07T00:26:12.551047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.534550Z","title":") (2007)","venue":null,"work_id":"3c4a7651-312f-4004-9521-886523c62f23","year":2007},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.509424Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:f8a703779e2c48123e46f1fc8b1f7f956306bd3203bcbe1b7314a18d5ff27929","observation_id":"5d32f3b0-2e87-4e9e-8d6c-33f4cca1fe19","resolution":{"observed_at":"2026-08-07T00:26:12.538873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.523466Z","title":null,"venue":null,"work_id":"b86370fe-7b26-4389-a82f-45d8c7e77e7d","year":2023},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.536476Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:331f15f6265c6e8d294006755776f46c374ed2dcfea26b82bd6ef68e6510ec48","observation_id":"94deb435-da9c-4961-a935-0acfedf1fabb","resolution":{"observed_at":"2026-08-07T00:26:12.527352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.512754Z","title":null,"venue":null,"work_id":"f5687b24-57f8-4aa0-9deb-a7865f95398f","year":2002},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.571412Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:75baefe90bc0f52e134f76d9070768fc718fceec50287bc4b540164cf274d28c","observation_id":"6234a868-4377-47f1-9dac-d17b2181f961","resolution":{"observed_at":"2026-08-07T00:26:12.516629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.501218Z","title":"M., Ullman, T","venue":null,"work_id":"d9a9dba7-ce16-49e0-8274-b83d20ce0e9c","year":2017},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.599864Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:39d0d0ad51097b1aae297e8b6c628c163f09eb56341a08a0829651a33fa2a9bd","observation_id":"2de0b570-b6ea-4a3c-9d0b-03930abaeb57","resolution":{"observed_at":"2026-08-07T00:26:12.505392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.489102Z","title":null,"venue":null,"work_id":"f7d042d3-7fb9-4bee-9c43-46ba388ec940","year":2015},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.625314Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:ef034726f2f284bdcb7e5be80c6a397442a8b32cbb270e1d46a8b4e01c7b4f4b","observation_id":"f91e5b18-bbd9-44f0-bf9b-b541749de1d7","resolution":{"observed_at":"2026-08-07T00:26:12.493610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.475647Z","title":null,"venue":null,"work_id":"530dd8e8-f587-4610-890a-76b8c1aef0c4","year":2017},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.652810Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:0c62e6722d692f82346ea7c9c0371592094de103106b38a9e2be052fdc64f6a1","observation_id":"4c03ea8b-6d66-4090-92ae-3b4aa305d2f9","resolution":{"observed_at":"2026-08-07T00:26:12.480367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.463688Z","title":"(1954).The construction of reality in the child","venue":null,"work_id":"2f63c691-329b-4072-a9b2-e694abcaf40b","year":1954},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.679382Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:9cab2c6a54876f4f3277e0109f761ab72210699800169f8daa83638baf423290","observation_id":"d90d9401-e5dd-4bdd-a372-e3a3e925b21e","resolution":{"observed_at":"2026-08-07T00:26:12.467654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.451911Z","title":null,"venue":null,"work_id":"5eefbcc7-9309-4013-86a0-971e1d0d6bde","year":2020},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.707986Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:f2914ec57e367ad01c4eea840c26422cb7a661fc6b92cd92dceb773135e5817b","observation_id":"2b8c91f8-036e-4bb4-a5d6-dc6aaf481042","resolution":{"observed_at":"2026-08-07T00:26:12.456216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.437709Z","title":"Vinyals, O","venue":null,"work_id":"505fd326-74a1-4221-8bb8-1d82f348e3e6","year":2024},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.735760Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:2bbd1bd3be096d7936017d4dd595380a9cba02fd637c540541151f803dd28807","observation_id":"d33afa8b-8a6f-434f-bcc6-66c9f8b656d6","resolution":{"observed_at":"2026-08-07T00:26:12.442630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.394070Z","title":null,"venue":null,"work_id":"891a34ea-d8a6-45cd-9b29-949ee6e107cb","year":2011},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.789656Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:e3685570805c31774afe3483e90b34a73688c2d7bd56aa37a2ba064ddc91b36b","observation_id":"26b4f656-d117-4b38-bbe4-c9f80fcceccb","resolution":{"observed_at":"2026-08-07T00:26:12.418058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-08-16T17:40:08.900487Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-07T00:26:11.819243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.819243Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:504c0745d26b3ba3b27941b95a0cfed8a1de50cf325256dae8a993c877ac6fbc","observation_id":"6a703fdf-aea1-4cd8-b995-2511481876bf","resolution":{"observed_at":"2026-08-07T00:26:11.819243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.323917Z","title":null,"venue":null,"work_id":"4958526f-c678-4059-8e87-e38b7e09a615","year":1968},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.854736Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:8b868a9278d8f61640e3591cb56f4c31080d37e95c0a0f265263115fdd138cfe","observation_id":"f8d326f8-2c5d-41f5-9a3f-4f98747dacdb","resolution":{"observed_at":"2026-08-07T00:26:12.354975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.263551Z","title":"G., & Sch¨on, T","venue":null,"work_id":"ad217052-6c32-4b2e-9117-3fae8e6a3b1e","year":2023},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.882599Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:983f896b2f70f13ca9cdfced87f2f774ce093e2537ecd9522c18fcb765cba48c","observation_id":"bff810e1-39a8-422b-8031-6cb9d65c95be","resolution":{"observed_at":"2026-08-07T00:26:12.293289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12672","last_updated":"2023-06-23T06:05:31Z","snapshot_observed_at":"2026-08-16T22:06:59.789757Z","submitted_at":"2023-06-22T05:14:00Z","title":"From Word Models to World Models: Translating from Natural Language to the Probabilistic Language of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12672","snapshot_observed_at":"2026-08-07T00:26:11.919119Z","title":"K., Goodman, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.919119Z"},"links":{"cited_paper":"/paper/2306.12672","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:980e4a269a1ef17db6ef5963bd61797a909184dac4f4fed7c3a17076a02a39f7","observation_id":"7de648e9-e30f-46eb-aaaf-8713c1da9f93","resolution":{"observed_at":"2026-08-07T00:26:11.919119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.199852Z","title":"H., & Tenenbaum, J","venue":null,"work_id":"e43a389f-8fbb-4630-b420-048af1fb1878","year":2016},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.946607Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:e6031663085ed1853ace46ffc9c941c6ad546e8d8afa8ed37fbfeaa088eaadf0","observation_id":"268add9a-3b9d-4693-85f7-5783bf1003b6","resolution":{"observed_at":"2026-08-07T00:26:12.223542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14325","last_updated":"2023-06-27T23:26:47Z","snapshot_observed_at":"2026-08-16T15:21:17.054490Z","submitted_at":"2023-06-25T19:38:01Z","title":"The Neuro-Symbolic Inverse Planning Engine (NIPE): Modeling Probabilistic Social Inferences from Linguistic Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14325","snapshot_observed_at":"2026-08-07T00:26:11.978908Z","title":"M., Wei, M., Zhang, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.978908Z"},"links":{"cited_paper":"/paper/2306.14325","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:7291ace64874a156dfbe124b867cd6cb4b61567c005bd1e7c01b068651df1a01","observation_id":"5a6252c3-6065-4d88-b704-cf84f354cede","resolution":{"observed_at":"2026-08-07T00:26:11.978908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20502","last_updated":"2026-08-12T07:09:05Z","snapshot_observed_at":"2026-08-16T02:47:27.347208Z","submitted_at":"2025-02-27T20:21:36Z","title":"On Benchmarking Human-Like Intelligence in Machines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20502","snapshot_observed_at":"2026-08-07T00:26:12.008828Z","title":"L., & Tenenbaum, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:12.008828Z"},"links":{"cited_paper":"/paper/2502.20502","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:38406ceb116e070f0ce63bb8a5b8443734eac03ca1a7e845456dd6376c5c07f2","observation_id":"f1bfedf2-d615-4aa1-914d-daa2980f72f4","resolution":{"observed_at":"2026-08-07T00:26:12.008828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.146720Z","title":null,"venue":null,"work_id":"ca85ea06-6be4-45be-adb4-bd31ed09d5f6","year":2025},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:12.042623Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:cd72b80385b653e4336d2152eec429de0c614841ec52520ac2ef254f278851ea","observation_id":"65aab872-1e94-48f3-b9f0-fb00abf8279d","resolution":{"observed_at":"2026-08-07T00:26:12.169526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T16:54:22.161895Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2506.14212."}