{"as_of":"2026-08-08T19:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76fde7998f4758e628d951ebf47a4d89a8a4fd30815dc6a2e0204c412805b8bd","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:32:35.754465Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:27:11.587733Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.994971Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09447","snapshot_observed_at":"2026-08-07T14:27:11.587733Z","title":"Pixel-level reasoning segmentation via multi-turn conversations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.587733Z"},"links":{"cited_paper":"/paper/2502.09447","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:a8c493207df54c57f513620e6c510dfb66b4e491e1a9cd6e38a9ec5001c4f165","observation_id":"f732ecc8-2281-48dc-9fa4-6ee936b81096","resolution":{"observed_at":"2026-08-07T14:27:11.587733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"cited_work":{"arxiv_id":"2502.09447","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09447","snapshot_observed_at":"2026-07-04T15:09:54.994971Z","title":null,"venue":null,"work_id":"6d454757-dc86-4d6a-8eb8-51f5b549b20e","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2502.09447","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:d33b4163bd7adbe277f24d0cce7706ebafe16fd2b9e0f36c1bbeeea1159b836b","observation_id":"769835ce-17f7-4880-9e08-652344dfe57b","resolution":{"observed_at":"2026-07-04T15:09:54.996380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09447/citation-record","integrity":"/paper/2502.09447/integrity","json":"/paper/2502.09447/citation-record.json","paper":"/paper/2502.09447"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.250287Z","title":null,"venue":null,"work_id":"e5bb1dbb-b536-4a37-a335-5ce9f02b6184","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.653165Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:88425816f3c43a1610709b8672afdf751c1d5d55a520007759500890a4fe3795","observation_id":"c6db1616-ec2d-489c-94b4-379a1d778894","resolution":{"observed_at":"2026-08-07T21:32:36.258107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.224535Z","title":"elements","venue":null,"work_id":"dc9f3a99-f1d9-42f3-933c-4b1b09cbfdd9","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.661258Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:9e85dc2bf9a8046bbb1f0eef3bbd6da12911a36608daa3f5dee766d5bc83f64b","observation_id":"1e11c994-debb-4b14-9967-a0349679670b","resolution":{"observed_at":"2026-08-07T21:32:36.229483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.150137Z","title":"root_node","venue":null,"work_id":"477a95ba-c866-418a-b13d-b45f13be5725","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.681903Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:8bb845eb6ae2cdf364c4ffd1f16575ae1e3b11588a84e455b3f9d9f6fe6d8e2b","observation_id":"9eeec598-c638-463f-98d1-88f4c410eab6","resolution":{"observed_at":"2026-08-07T21:32:36.157141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.026070Z","title":"## Evaluation Criteria:","venue":null,"work_id":"a67ccf25-a6ed-4c8f-bff9-1ead609b13d3","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.727449Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:5b1f5b1a9f75c748cd1bfd57807fc66e5cd86d51831ae4a3067fdc634412812a","observation_id":"598d678b-0c74-4edf-bd45-831376570bed","resolution":{"observed_at":"2026-08-07T21:32:36.031051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-07T21:32:35.643496Z","title":"Please seg- ment the apple in the image","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.643496Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:12e20317c9a40f887f76b423d7b6632903856e3968835467d513c602bf0db396","observation_id":"71dab4a7-cbaf-4e5b-8892-04adfcfe1806","resolution":{"observed_at":"2026-08-07T21:32:35.643496Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.194634Z","title":null,"venue":null,"work_id":"0182970e-3423-475d-80b9-43f0b594960e","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.668632Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:2c5e7042d37dba0cd9aa176570135af717f0e684a820b562d8ae61ec78db9fd8","observation_id":"709e0f37-bdbb-4fa8-b966-007b20efe45f","resolution":{"observed_at":"2026-08-07T21:32:36.202636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.171231Z","title":null,"venue":null,"work_id":"c87b2dd0-ceee-419b-afad-eae80e5a3c0b","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.675230Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:19fe93a20388e3f18afb008dc03b49dea4880b7463680934e19fa380142a8d98","observation_id":"d3057c68-c285-47a5-b0d5-cc1469c39765","resolution":{"observed_at":"2026-08-07T21:32:36.177271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.130864Z","title":null,"venue":null,"work_id":"3685a492-802c-4612-b978-871440d74102","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.691145Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:0f353d32868a0e87fab4deee137701d62ce985904b9027e491afd063112a0037","observation_id":"9e7d98ac-2c3d-42a1-acaf-dd070df549c2","resolution":{"observed_at":"2026-08-07T21:32:36.137075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.104292Z","title":"Question1","venue":null,"work_id":"cde25fae-1c03-44d1-b95e-3de66bb3b0f7","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.699076Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:5ff2554fe665541c5c2237b9cce4c58df955d0c422530e3c07732454e74c37f1","observation_id":"9842abb9-3f9b-40c2-9add-975f23f92264","resolution":{"observed_at":"2026-08-07T21:32:36.110917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.080174Z","title":null,"venue":null,"work_id":"1b57ee2b-25e8-4d86-b5e6-27b8c5092ba3","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.705120Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:f51f70546da8652fd2832126297acc574f09a84787ff7b359af78d6279c53ced","observation_id":"9a022489-44ce-44f1-9b9c-2258f2b51cba","resolution":{"observed_at":"2026-08-07T21:32:36.087277Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.061576Z","title":null,"venue":null,"work_id":"ca4ccd1f-0a42-4120-bce5-1e3b873666ed","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.712772Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:6cca1806911708e4606001def98f62d0f3fa0b8e947e35972a51dcd6b5a3da62","observation_id":"25694c61-3bf1-4f1e-b4e0-b311ce61737e","resolution":{"observed_at":"2026-08-07T21:32:36.067647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.043315Z","title":null,"venue":null,"work_id":"1228128b-6244-46ae-8979-877c8dbe15b6","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.721700Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:9568624f8f9c55823c642b5767987ca47f03b783fa7683d69b4947ac1c988147","observation_id":"6173aee2-bb44-41c6-8665-cbd989a786cc","resolution":{"observed_at":"2026-08-07T21:32:36.048594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:36.007039Z","title":"2-3 points: Partially advances the dialogue, but the connection feels somewhat awkward","venue":null,"work_id":"b1b589c4-f511-46db-a994-f9ca757f78b5","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.732881Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:d50fbd0916b710b4e5941308ed161ff762b23d6139945b08d7706e70475eb33d","observation_id":"e6843996-5274-422d-abc7-8fc1554f7ef9","resolution":{"observed_at":"2026-08-07T21:32:36.012665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:35.989289Z","title":"2-3 points: Generally clear logic, but with minor gaps or weak links","venue":null,"work_id":"76df8082-4d26-47cb-810b-4f890b8e5fc7","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.739605Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:de7485755f0044475c195217de2d62369b5d2d465b54a4075d5b8bd25a049055","observation_id":"a80e8f61-196c-4eae-bc2b-52649663567c","resolution":{"observed_at":"2026-08-07T21:32:35.994970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:35.966936Z","title":"2-3 points: Generally consistent, but with a slight deviation","venue":null,"work_id":"932548f4-f45f-4989-a3c9-3e900015b1b5","year":null},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.748015Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:4713888fa37c3dbe6867cc9abd90f264d247e7feb60be3cd4c0be7d245ace94a","observation_id":"631e28e0-3275-409f-9412-46a59a8b43d7","resolution":{"observed_at":"2026-08-07T21:32:35.973543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:32:35.945013Z","title":"scores\": [ {","venue":null,"work_id":"8f2f1062-9744-4995-8f41-0845d5996082","year":1953},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.754465Z"},"links":{"citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:fe71214ac1d6c22dd7329f1b7760013772879e3bfd333f2fe0562d10bb0060d8","observation_id":"6f688221-4ff9-4b62-a5e5-4df037a6566a","resolution":{"observed_at":"2026-08-07T21:32:35.951907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-06T07:43:56.889679Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T21:32:35.621068Z","title":"International journal of computer vision, 123:32–73","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.621068Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:4cf7f5d24f4be2a7af006d50e5590e093441a7b89f796f8fcd92a45003143d68","observation_id":"2ba89b2b-c607-46b3-9c58-1a1a3c8095b5","resolution":{"observed_at":"2026-08-07T21:32:35.621068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T21:32:35.610024Z","title":"In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 1209–1218","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.610024Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:91a376150bc6f29ddf6348d87061ac9577d450a0b278d100a9023609e2f6322b","observation_id":"e38a9a1a-9a8f-4458-b8ba-76abeabc2b25","resolution":{"observed_at":"2026-08-07T21:32:35.610024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T21:32:35.629600Z","title":"arXiv preprint arXiv:2306.14824","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.629600Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:5f7ff17d95e0339a0f875326808a71a3b16518a22a594b23dc95ae37e8224f3d","observation_id":"ce9697d5-4752-46b1-a2cf-355fef0e11be","resolution":{"observed_at":"2026-08-07T21:32:35.629600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12462","last_updated":"2020-08-04T04:08:02Z","snapshot_observed_at":"2026-08-08T19:19:16.384370Z","submitted_at":"2020-03-24T02:38:35Z","title":"TextCaps: a Dataset for Image Captioning with Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12462","snapshot_observed_at":"2026-08-07T21:32:35.636508Z","title":"In Proceedings of the IEEE/CVF Con- ference on Computer Vision and Pattern Recognition, pages 26374–26383","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.636508Z"},"links":{"cited_paper":"/paper/2003.12462","citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:50a8249d5d55d3e8b996b602fdf496c0422a7c9d4fc4554f3c2f9d02d0b61fe4","observation_id":"ebbae687-f0bb-479c-a845-fd2fb1e7b95b","resolution":{"observed_at":"2026-08-07T21:32:35.636508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 2 inbound Pith citation observations for arXiv:2502.09447."}